2023年智能体专题报告:智能体打开智驾与机器人的星辰大海

  • 来源:中银证券
  • 发布时间:2023/12/31
  • 浏览次数:1070
  • 举报
相关深度报告REPORTS

智能体专题报告:智能体打开智驾与机器人的星辰大海.pdf

智能体专题报告:智能体打开智驾与机器人的星辰大海。智能体能够以自动驾驶汽车、机器人等多种形式落地,或将诞生生成式AI杀手级应用。智能体(AIAgents)是一个可以通过行动能力自主完成设定的目标的代理,能够不断迭代学习与环境相互适应。智能体与“本体”耦合后,即形成具身智能。根据不同的具身方法,智能体能够以自动驾驶汽车、机器人等多种形式表现。生成式AI经历大模型打磨成熟阶段之后,算力的消化需要市场空间广阔的杀手级应用,智能体有望成为这样的典型应用落地场景。智能体与物理实体结合,能够大大减少人工代码量并且对未预先编程的场景进行操作。区别于CV、NLP等传统深度学习模型,与&...

智能体:自动驾驶汽车与人形机器人的智能大脑

智能体不依靠被动数据投喂,具备自主学习的能力

智能体是自主完成设定的目标的代理,能够不断迭代学习以与环境相互适应。根据 MoPaaS 创始人 和 CEO 鲁为民博士在《大语言模型时代的智能体 (I):什么是智能体?》一文中的定义,智能体(AI Agents 或 Agents)是一个可以通过行动能力自主完成设定的目标的代理。智能体具备一些类似人的 智能能力和行为,比如学习、推理、决策和执行能力。智能体具备感知、观测、决策和执行四大模 块,通过反馈来感知环境及其动态变化,并将行动策略反馈作用于环境,以实现不断迭代学习与环 境相互适应。

自动驾驶汽车、人形机器人都可成为智能体的载体。根据智元机器人 CTO、首席架构师稚晖君的定 义,智能体与“本体”耦合后,即形成具备物理实体的、且能够在复杂环境中执行任务的智能系统。 其中本体作为实际的执行者(通常是具有物理实体的机器人),在物理或者虚拟世界进行感知和任 务执行;而智能体则承担智能核心的作用,负责感知、理解、决策、控制等工作。卢策吾教授在机 器之心 AI 科技年会上发表的《具身智能是通往 AGI 值得探索的方向》中提到,智能体通过感知器 和执行器与环境进行交互,能够实现获取信息、理解问题等功能,并根据环境的变化做出相应的决 策和行动。根据选择的不同具身方法,智能体能够以机器人、自动驾驶汽车等多种形式表现。

智能体相比传统深度学习模型具备自主学习的能力。CV、NLP 等传统深度学习模型主要通过第三视 角以互联网图像、视频或文本等数据集进行学习,其训练主要依靠被动数据投喂。而具身的智能体 以第一视角进行感知,并与环境交互,不依靠被动数据投喂,具备主动学习的能力以及较强的泛化 性。1963 年,麻省理工学院教授理查德·赫尔德通过对比实验发现:当猫的脚被绑住放进盒子里时, 即使其能正常观察环境,但并不能发育出正常的视觉能力;而另一只可以自由行走的猫在完全相同 的环境下,则发育出了正常的视觉能力,因而他认为只有“具身”的训练,才能真正学习与理解外部 的环境与信息。

智能体带动机器人实现升维进阶

由智能体赋能的机器人以任务完成为导向,相比传统机器人大大减少了编程的需要。传统模式下, 机器人以程序执行为导向,通常需要经过任务定义、将任务分解为动作、编写程序以及执行任务等 流程。工程师需要构建高低级指令代码,并且随时更改代码以修正机器人行动,整个过程耗时长且 成本昂贵。而搭载智能体的机器人以任务目标为导向,不仅仅是机械地完成程序。具身的智能体可 以根据环境变化,对行动细节进行实时修正,其自主学习能力能够消除在特定条件下为特定任务反 复编程的需要。

微软在《ChatGPT for Robotics: Design Principles and Model Abilities》中提出,大语言模型(LLM) 能给机器人提供常识,非工程师也可对机器人进行控制。操控者只需准备好机器人底层的函数库, 并对其进行描述。将任务目标告诉 ChatGPT 后,ChatGPT 即可自动完成代码并应用在具身智能机器 人上。以居家机器人为例,设计者只需写出机器人进行物品定位、移动到某一位置、抓取物体以及 做饭的函数库,然后告知 ChatGPT 相应函数的作用以及要到达的目标,ChatGPT 就会自动写出相应 代码。

搭载智能体后机器人涌现能力显著提升,可完成没有预先编程的新场景。7 月谷歌 DeepMind 推出机 器人模型Robotics Transformer 2(RT-2)。RT-2以视觉-语言模型(VLMs)为基础,以Pathways Language and Image model(PaLI-X)和 Pathways Language model Embodied(PaLM-E)为支柱,通过输入图 像生成一系列自然语言文本的标记。RT-2 可用于执行视觉问答、图像字幕或对象识别等任务。RT-2 展现了较好的涌现能力,即从原始训练数据中自动学习并发现新的、更高层次的特征和模式的能力。

在谷歌具身智能试验中,机器人对从未见过的对象或场景上执行操作任务,在仅依据网络数据知识 的情况下,机器人可完成诸如“拿起即将从桌上掉下来的袋子”或“将香蕉移动到 2 加 1 的和”等任务。 实验结果显示,RT-2 对于未曾见过的情景的平均成功率达 60%,相比 RT-1 提升了 3 倍以上。

蓝海市场前景广阔,产业端加速落地

蓝海市场前景广阔,5 年市场规模复合增速有望超 50%

具身智能体市场空间广阔,5 年市场规模 CAGR 有望超 50%。智能体目前仍处于发展初期阶段,其 与机器人、自动驾驶、智能传感器和智能设备、增强现实(AR)和虚拟现实(VR)等多个行业相 关,市场空间广阔。以人形机器人市场规模进行参考,据 Markets and Markets 测算,到 2028 年全球 人形机器人市场规模将达到 138 亿美元,复合增长率预计为 50.2%。

政策密集催化。2023 年以来,多项智能体相关政策陆续发布。5 月,北京市发布《北京市促进通用 人工智能创新发展的若干措施(2023-2025 年)(征求意见稿)》,提出要探索具身智能、通用智能 体和类脑智能等通用人工智能新路径。同期,上海发布《上海市推动制造业高质量发展三年行动计 划 (2023-2025 年)》,提出要瞄准人工智能技术前沿,建设国际算法创新基地,加快人形机器人创 新发展。湖北、深圳、广东等省市纷纷加快布局,促进产业高速发展。政策带动下,智能体产业进 入快车道。

产业端加速落地,Gemini 有望接入机器人

英伟达推出多模态具身智能系统 Nvidia VIMA。英伟达创始人黄仁勋在 ITF World 2023 半导体大会 上表示,AI 下一个浪潮将是“具身智能”,具身智能将开启新的应用和市场,如智能机器人、智能医 疗、智能教育等。目前英伟达已推出多模态具身智能系统 Nvidia VIMA,并在 NVIDIA AI 上运行。 Nvidia VIMA 能在视觉文本提示的指导下,执行复杂任务,如在虚拟环境中搭建乐高积木、在真实 环境中操作机器人手臂等。

谷歌打造“通才”AI 模型 PaLM-E。3 月,谷歌联合柏林工业大学团队发布 PaLM-E(Pathways Language Model with Embodied),参数量高达 5620 亿。PaLM-E 是 PaLM-540B 语言模型与 ViT-22B 视觉 Transformer 模型的结合,它基于谷歌现有的 “PaLM”大语言模型 (类似于 ChatGPT 背后的技术)。 谷歌通过添加感官信息和机器人控制,使 PaLM“具身化”。 PaLM-E 可以连续观察图像信息或传感 器数据,并将它们编码为一系列与语言标记大小相同的向量,使得模型以与处理语言相同的方式“理 解”感官信息。同时,PaLM-E 还借鉴了谷歌之前在 ViT-22B 视觉 Transformer 模型上的工作。ViT-22B 接受过各类视觉任务的训练,如图像分类、对象检测、语义分割和图像字幕。作为多模态具身视觉 语言模型(VLM),PaLM-E 不仅可以理解图像,还能理解、生成语言,还可以执行各种复杂的机 器人指令而无需重新训练。

当被要求执行“把抽屉里的薯片拿给我”的任务的时候,PaLM-E 首先对机器人相机的数据进行分析, 而非对场景进行预处理(消除了人类预处理或注释数据的需要),以实现更自主的机器人控制。随 后 PaLM-E 引导机器人从厨房取出薯片袋,当研究人员从机器人拿走薯片后,机器人仍然能找到薯 片并再次抓取它们。

Gemini 具备强泛化能力,有望成为机器人智能体。12 月 6 日,谷歌原生多模态大模型 Gemini 发布。 Gemini 可泛化并无缝理解、操作和组合不同类型的信息,包括文本、代码、音频、图像和视频。它 包括三种量级:能力最强的 Gemini Ultra,适用于多任务的 Gemini Pro 以及适用于特定任务和端侧 的 Gemini Nano。其中 Ultra 版可用于大型数据中心等,属于处理高复杂度任务的模型;Pro 版则用 于各种扩展任务,属于日常使用模型,目前已搭载于谷歌的对话机器人 Bard 中;Nano 版则是应用 于智能手机等移动设备终端上的模型。与 BERT 等模型相比,Gemini 具有更多的参数和更深的网络 结构,此外 Gemini 还采用了更先进的训练方法,例如知识蒸馏和自监督学习等,模型泛化能力显著 提升。在 GLUE 和 SQuAD 等多项自然语言处理基测试中,Gemini 分别取得了 94.1%和 93.3%的准 确率。谷歌人工智能高管哈萨比斯在接受杂志 Wired 采访时表示,谷歌 DeepMind 已经在研究如何 将 Gemini 与机器人技术结合起来,与世界进行物理互动。

阿里千问大模型有望接入工业机器人。在第六届数字中国建设峰会上,阿里巴巴董事会主席兼 CEO、 阿里云智能集团 CEO 张勇透露:阿里云工程师正在实验将千问大模型接入工业机器人。接入千问大 模型后,在钉钉对话框输入人类语言,操作者即可远程指挥机器人工作。通过钉钉对话框向机器人 发送“我渴了,找点东西喝吧。”的指令后,千问大模型在后台自动编写代码发给机器人。机器人对 周边环境进行识别,在找到水后,自动完成移动、抓取、配送等一系列动作,并顺利递送给工程师。

国内首款开源鸿蒙机器人发布。12 月 5 日,国内首款可跳跃的开源鸿蒙人形机器人在深圳发布,该 款机器人人形机器人 KUAVO(夸父)由乐聚自主研发,重量约 45kg,全身自由度 26 个,步速最高 可达 4.6km/h,快速连续跳跃高度超过 20cm,是国内首款可跳跃、可适应多地形行走、并且可实现 量产的开源鸿蒙人形机器人。目前,夸父已进入全面量产阶段,并在科研教育和特种作业领域率先 实现商业化落地。乐聚机器人也有望因此成为国内首家实现大机器人量产交付单位。

端到端大模型与数据模拟两大方向值得关注

自动驾驶智能体短期内有望快速落地,机器人智能体接力打开中长期想象空间。根据北京智源人工 智能研究院院长、北大多媒体信息处理国家重点实验室主任黄铁军在 2023 STIC 科技创变者大会上 的演讲,随着技术迭代速度加快,1-3 年内 L4、L5 级别的自动驾驶技术有望实现,而搭载智能体的 机器人则会在未来 5-10 年出现,并对制造业进行颠覆与替代,同时进入普通家庭 To C 场景。我们 认为短期内,自动驾驶有望成为具身智能体的首个落地方向,端到端大模型技术有望快速超越现有 范式,奇点已经临近;中长期生成式模型的快速迭代有望加快 Robot RPT 进程,产业存在大量模拟 数据需求。

端到端大模型有望打造自动驾驶领域 Drive GPT

特斯拉 FSD V12 采用端到端训练方法,与 ChatGPT 训练模式类似。ChatGPT 采用端到端的训练方 法,其关键基础是生成式大规模语言模型。ChatGPT 以生成式的自监督学习为基础,在大量的未标 注文本数据上训练模型,使其能够学习语言的普遍规律和语言结构。而特斯拉 FSD V12 同样采用端 到端训练方法,与 ChatGPT 技术路径一致。在常规自动驾驶系统开发中,探测、跟踪、静态环境建 图、高精地图定位等子模块分别由不同的团队分担,各团队负责各自模块的结果输出,因此各个模 块之间存在明显的界限和区隔,使得模块容易存在局部最优,而非全局最优的情况。而端到端的设 计则是将各个模块用可微分的方式连接起来,使任务得到了联合和全局优化。除此之外,端到端前 期不需海量代码或提前设计规则,只需不断输入人类驾驶数据,系统就能不断更新迭代。

FSD V12 神经网络取代传统分模块设计。特斯拉宣布已开始向员工推出完全自动驾驶(FSD)V12 版本。特斯拉 FSD V12 使用全球各地数百万特斯拉车身视频作为训练材料来模仿人类司机的驾驶决 策,采用“光子进入,控制输出(photon in, controls out)”。目前常见自动驾驶系统多采用分模块设 计,即分为感知、决策、控制三个模块。车辆通过传感器感知周遭环境,确定车辆位置、速度、加 速度,并根据识别出来的语义进行行驶路线的规划和横纵向的决策,最后通过转向和制动机构控制 车辆行驶,各任务内部采用各自的算法模型,感知、决策与控制之间界限明确。而特斯拉将规划和 控制由代码改成了神经网络形式,与感知层的神经网络合并成了一个大网络,仅利用一套神经网络 就能处理所有输入信号,并输出驾驶决策。

FSD V12 代码量相比 V11 减少 99%。相比 V11,V12 最主要的更新在于其 99%决策都是由神经网络 给出,这一更新减少了车机系统对代码的依赖,使其更加接近人类司机的决策过程。这是特斯拉首 次放弃代码,使用神经网络进行车辆控制。与 V11 相比,V11 使用超过 30 万行代码,依靠工程师 硬核编码对车辆进行控制。而 FSD V12 则可通过神经网络控制转向、加速和制动。目前,FSD V12 的 C++代码只有 2000 行。

具备核心数据积累,影子模式有望支撑神经网络加速训练。特斯拉影子模式的运作方式是在有人驾 驶状态下,运行自动驾驶系统和传感器,系统虽不参与车辆控制,但仍持续进行模拟决策,并把决 策与驾驶员行为进行对比。两者不一致时,系统将场景判定为“极端工况”,进而触发数据回传。因 而特斯拉的使用用户越多,收集的数据就越多。

大模型的训练依赖海量数据的提供,提供的数据越多,训练质量就越优异。在特斯拉 2023 年股东 大会上,马斯克透露 FSD 累计行驶里程已经接近 2 亿英里。据 Lex Friedman 发布的数据显示,截 至 2020 年 1 月 16 日,特斯拉的所有汽车行驶里程达到 191 亿英里,其中自动驾驶里程为 22 亿英里。 相比之下,同时期 Waymo 路测里程约为 1000 万英里,特斯拉于数据储备方面具明显优势。马斯克 发现,当输入超过 100 万个视频后,基于神经网络的自动驾驶系统开始表现良好。目前 FSD V12 已 使用包含 1000 万个视频的数据集。并且特斯拉在全球各地近 200 万辆的车队,每天也会提供约 1600 亿帧视频用于训练。特斯拉预计,未来用于训练的视频将达到数十亿帧。

奇点临近,端到端系统有望超越现有范式。根据小鹏 XPILOT 总监 Patrick Liu 在 CVPR 2023 上的演 讲,分模块的方式允许开发人员以最少的努力快速工作,但通常会导致自动驾驶性能上限为 80%, 而端到端以全局最优为导向,相比传统分模块的范式具备更高上限。然而在端到端系统起步初期, 需要重复多次才能不断突破性能天花板。从图中我们可以看出,当端到端系统达到现有技术水平的 时间点后,将会快速超越技术栈。

在 8 月 26 日马斯克 45 分钟直播试驾中,FSD Beta V12 在面对之前从未见过的建筑、道路标志时能 够进行识别,并轻松绕过障碍物。对于同样未经过编程的环形交叉路口概念,FSD V12 顺利完成转 弯行驶。只需输入目的地地址,FSD V12 就可自动行驶到达目的地,并将车停到合适的位置。YouTube 博主 CallasEV 将特斯拉 FSD 与 Waymo 进行了长距离驾驶对比。从同一地点出发到同一终点,Waymo 全程用时 54 分 42 秒,而特斯拉的路线用时仅为 26 分 27 秒,用时不到 Waymo 的一半。

UniAD 成为国内首个端到端自动驾驶大模型。6 月 21 日,全球人工智能和计算机视觉领域顶级国际 会议 CVPR2023 宣布由上海人工智能实验室、武汉大学及商汤科技联合发表的论文《以路径规划为 导向的自动驾驶》(Planning-oriented Autonomous Driving,UniAD)获最佳论文奖。在 UniAD 中, 研究人员首次将感知、预测和规划等三大类主任务、六小类子任务(目标检测、目标跟踪、场景建 图、轨迹预测、栅格预测和路径规划)整合到一个基于 Transformer 的端到端网络框架下,实现了全 栈关键任务驾驶通用模型。在 nuScenes 真实场景数据集下,UniAD 的所有任务均达到领域最佳性能 (State-of-the-art,SOTA),尤其是预测和规划效果方面。其中,多目标跟踪准确率超越 SOTA 20%, 车道线预测准确率提升 30%,预测运动位移和规划的误差则分别降低 38%和 28%。

机器人:海量数据模拟需求有望释放

机器人领域尚未形成底层通用大模型。根据达闼机器人创始人、董事长兼 CEO 黄晓庆 9 月 20 日在 2023 亚布力智能制造发展论坛上的发言,Robot GPT 是智能制造领域需要的各种垂直的、从事各种 生产的通用机器人的大脑,可以传承各种长期积累的工作经验,且不需要人类编程,只需要人类以 自然语言的方式来进行记录。但当下机器人在不同的技能情况下仍需要不同的大模型,底层通用平 台尚未形成。目前机器人领域主流的具身智能大模型主要包括谷歌 PaLM-E、Robotic Transformer 以 及 LM-Nav 等,这些大模型各自针对不同细分场景。

PaLM-E 在规划方面优势突出。PaLM-E 能够进行长期推理规划,抵抗任务期间可能发生的中断。 在处理机器人任务时,PaLM-E 获取到用户使用自然语言定义的长期任务目标后,会根据当前机器 人的状态和感知信息,生成逐步的低级文本指令,并交由下游控制模块执行。根据每一步的执行结 果及场景的变化,机器人会重新对下一步进行规划。在谷歌视频演示中,当研究人员从机器人手中 抓取薯片并移动它们时,机器人能够再次找到薯片并抓取它们。

Robotic Transformer 主要针对控制场景。Robotic Transformer 2(RT-2)是视觉语言行动(VLA) 模型,它从网络和机器人数据中学习,并将这些知识转化为通用指令以控制机器人。RT-2 具备较强 的思维链能力,可以完成多步骤逻辑推理,能够用复杂文本指令直接操控机械臂,中间不再需要将 其转化成简单指令,通过自然语言就可得到最终的行动。在面对图像输入时,RT-2 模型在输入图像 数据后会首先输出语言规划结果,再把语言规划结果分解成动作,控制机器人完成。RT-2 在物流、 制造、安保等领域应用广泛。

LM-Nav 主要针对导航场景。LM-Nav 主要基于大型语言模型(LLM)、视觉和语言模型(VLM) 以及视觉导航模型(VNM)。其中 VNM 负责根据环境中的观测值构建拓扑图,LLM 用于提取指令 中的地标,VLM 对所描述的地标和图像的联合概率分布进行推断。之后系统利用 VLM 的概率分 布和 VNM 推断的图连接性,从环境中检索出最优指令路径,并由 VNM 进行执行。在没有微调的 情况下,LM Nav 可实现无需对机器人导航数据进行人工注释。

Robot GPT 与 ChatGPT 技术路径相似,生成模型有望加快 Robot GPT 进程。Robot GPT 不需人类 编程,只需人类用自然语言的方式来进行记录。根据《RobotGPT: From ChatGPT to Robot Intelligence》, RobotGPT 框架图思路类似于 ChatGPT:ChatGPT 的原理可理解为文字-文字的接龙,而 Robot GPT 原理是文字/语言/各类传感器接收的信号-动作接龙,两者皆是通过深度学习和强化学习构建端对端 AI 大模型。

Open AI 领投的人形机器人公司 1X Technologies AI 副总裁 Eric Jang 在《我们如何让机器人更像生成 模型?》中提到,机器人相比生成式模型发展相对落后的原因在于大多数研究者仍在使用相对落后 的 ResNet18 深度学习架构,而非在生成模型的巨大的数据集上进行模型训练。但随着生成模型的迅 速发展,Robot GPT 进程有望加快。2018 年 6 月,OpenAI 发布 GPT-1 模型,参数达 1.1 亿。同年 11 月,GPT-2 模型发布,参数提升至 15 亿。2020 年 5 月,GPT-3 的 beta 版本推出,模型参数迅速 提升至 1750 亿。随后大模型发展开始进入到百花齐放阶段。2021 年 1 月,谷歌推出 Switch Transformer, 参数量达 1.6 万亿,是史上首个万亿级语言模型;同年 12 月,谷歌推出了 1.2 万亿参数的通用稀疏 语言模型 GLaM。2022 年 5 月,Meta AI 发布超大规模语言模型-OPT-175B,是参数超过千亿级别的 开放模型。2023 年 12 月,谷歌 Gemini 原生多模态大模型发布,模型分为 Ultra、Pro 和 Nano 三个 规格,目前 Gemini Pro 模型已整合到 Google AI Studio 和 Vertex AI 中,可供企业在开发中使用。

生成模型正逐步运用到机器人大模型中。2023 年 7 月,斯坦福大学李飞飞团队发布 VoxPoser 系统, 将大模型 ChatGPT 4+VLM,接入至机器人,可在无需额外数据和训练的情况下,将复杂指令转化为 具体的行动规划。在给定环境信息和要执行的自然语言指令后,LLM(大语言模型)直接相应内容 编写代码,并将所生成代码与 VLM(视觉语言模型)进行交互,指导系统生成相应操作指示地图, 即 3D Value Map,最后,运动规划器合成 6-DoF 动作,整个流程无需对模型进行任何额外的训练。

打造 Robot GPT 的关键是解决数据稀缺问题。Robot GPT 的泛化能力与 LLM 大模型的赝本数量直 接相关。根据《PaLM-E: An Embodied Multimodal Language Model》,谷歌 PaLM-E 62B 的 LLM 相 对于 8B 的 LLM 体现了更好的 out-of-distribution 泛化性,LLM 数据量的提升显著增强了 RObot GPT 泛化性。目前通过大模型的涌现能力和思维链能力,可以使部分任务零样本学习到,但 Voxposer 机 器人还是局限在桌面上进行操作,如果要实现更广阔空间的扩展,仍需要高质量数据做支撑。

数据仿真有望成为产业突破关键。区别于非具身智能,具身智能需要实际部署到真实环境中,才能 够采集数据,但目前探索真实环境成本高昂且需要海量数据。智元机器人 CTO、首席架构师稚晖君 在接受媒体甲子光年的采访中表示,现在 LLM 的预训练通常需要 web-scale 级别的数据,而具身智 能的场景更为复杂,数据获取难度进一步加大。而数据仿真具备完善的数据分布,不仅涵盖 common case,同时也涵盖大量 corner case,尤其是现实中获取难度极大,获取代价极高的数据。其数据成 本低且可以规避数据隐私和安全问题。根据《Will we run out of data? An analysis of the limits of scaling datasets in Machine Learning》文中预测,2026 年文本数据将被训练完,而图像数据将在 2040 年左右 耗尽。根据 Gartner 的预测,2026 年模型训练数据中的 50%将由合成数据构成;2030 年合成数据的 质量将全面超过人类标注的真实数据。数据仿真或将成为产业突破关键。

 

编辑:520中国
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至