2026年机械行业人形机器人系列深度报告(四):具身大模型,人形机器人智慧内核,数据飞轮驱动迭代跃升

  • 来源:兴业证券
  • 发布时间:2026/04/16
  • 浏览次数:226
  • 举报
相关深度报告REPORTS

机械行业人形机器人系列深度报告(四):具身大模型,人形机器人智慧内核,数据飞轮驱动迭代跃升.pdf

机械行业人形机器人系列深度报告(四):具身大模型,人形机器人智慧内核,数据飞轮驱动迭代跃升。具身大模型是人形机器人的“大脑”,主导“感知-认知-控制”交互闭环。传统大模型专注于单一或少数模态的任务处理,缺乏与物理世界直接交互的能力。具身大模型作为人形机器人的“大脑”,从“感知-认知-控制”层面赋能机器人,强调与物理世界的交互,需具备多模态感知、自主决策、实时交互执行、通用与泛化等能力。人形机器人目前尚未实现大规模应用,主要原因或非硬件能力不足,而是大模型存在瓶颈。从产业进程来看,当前机器人肢体层技术...

具身大模型:人形机器人大规模应用的瓶颈

具身大模型:人形机器人大脑,主导“感知-认知-控制”

具身大模型是人形机器人的“大脑”。人形机器人主要由“大脑”、“小脑”和“肢体”三个部分组成,“大脑”负责实现环境感知、 行为控制、人机交互等任务级能力,目前主要是基于具身智能大模型技术,提高机器人的智能水平。 

具身大模型从“感知-认知-控制”层面赋能机器人。具身大模型需具备以下能力:1)多模态感知;2)自主可靠决策;3)实时交互 执行;4)通用性与泛化能力。

相较于传统模型,具身大模型集成多模态,强调机器人在本体与物理世界的交互中实现算法的进化。传统大模型专注于单一或少数模 态的任务处理模型,缺乏与物理世界直接交互的能力,而具身大模型需要集成包括文本、视觉、音频和触觉在内的多种模态,且当模 型控制机器人本体与环境交互时,可以通过反馈的数据进一步迭代算法,从而提升模型的能力,以及对于新场景和新任务的适应能力。

具身大模型:人形机器人大规模应用的瓶颈

人形机器人目前尚未实现大规模应用,根本原因或非硬件能力不足,而是具身智能大模型面临瓶颈。据宇树科技创始人王兴兴,目前人 形机器人硬件已经足够支持应用,机器人当下及未来最关键的挑战主要为大模型的能力还不足以支持大规模应用。具体而言:

1)从产业进程来看,目前大脑层与小脑层的发展远落后于肢体层。2025年,代表机器人物理本体的肢体层技术已处于成熟期,而代表运 动控制的小脑层技术,以及代表高级认知与决策能力的大脑层技术,却基本集中在技术萌芽的导入期。

2)从终局目标来看,AGI(通用人工智能)的实现,即具身智能从当前的L2向L3-L5跨越,主要依靠大模型的迭代。灵巧手、传感器等 硬件的升级使得人形机器人机械性能提升,目前已经能够实现柔性操作,但想要具备更高的通用性,并最终具备与人类等同的能力,关 键在于算法创新,即大模型的迭代升级。

架构:尚未收敛,主流路线为分层式与端到端式

当前具身智能大模型主流框架为分层式与端到端式,路径尚未收敛。

1)分层框架:分层具身模型采用“大脑-小脑-肢体”的架构,上层大模型负责感知与决策,底层硬件层和中间响应快的小模型负责 分解与执行。这类模型更适合当前的数据积累水平,且更容易融入基于学习的控制方法,因此被更多厂商采用。

2)端到端系统框架:端到端大模型能够直接实现从人类指令到机械臂执行的过程。输入图像及文本指令后,模型输出夹爪末端的动 作轨迹。这种方式简化了系统的层次结构,提高了响应速度,但由于缺乏中间逻辑推理层,对海量数据的依赖度较高,目前尚未成为 主流选择。

分层式架构:通过大小脑分层,机器人更易落地

传统决策采用分层范式,包括感知与互动、高层规划、低层执行以及反馈与增强。机器人的控制一般可以粗略地分为高层和低层。高层负责 全局、长期的目标;低层负责具体操作与及时反馈。虽然基础模型具有丰富常识与较强的推理能力,但精确性、实时性较差,所以大模型往 往不会直接参与机器人的低层次控制,而是通过需求理解、任务规划、动作生成等方式进行较高层级的控制。

通过大小脑分层,人形机器人更容易落地。受现实部署约束,在端侧实时跑大模型受限于端侧芯片的迭代速度,通过大小脑分层、分别部署 在边缘侧和端侧的设计,机器人更容易落地。此外,分层架构更符合生物进化规律。

分层范式依赖于独立的任务规划、动作执行和反馈模块,因此存在错误累积的问题,并且在跨多样任务泛化时表现不佳。分层架构的缺陷在 于前层的微小错误会在后续环节快速放大,而且更多的人为干预往往会降低模型效果。此外,高层模型不理解物理约束,常常分配不可能完 成的任务;而底层模型缺乏语义理解。

海外典型具身大模型

国外人形大模型进展

国外典型的具身智能大模型有谷歌DeepMind的RT-2、特斯拉的FSD、Physical AI的π0、Figure AI的Helix、英伟达的GR00T N1。 当前,基于基础模型的机器人模型在广泛的多模态多样本数据上进行预训练,并可以通过微调适应各种多过程复杂任务。诸如谷歌 的RT-1/RT-2和PaLM-E、Physical AI的π0 /π0-FAST/π0.5、以及Figure AI的Helix等机器人大模型已在机器人控制领域展现出实力, 包括端到端控制、对象泛化性、快速高效训练、零样本能力和复杂决策和快速动作的同时实现等。

谷歌DeepMind RT-1:端到端技术路线代表

谷歌DeepMind的RT模型是端到端技术路线代表。2022年10月,谷歌DeepMind发布RT-1模型,其训练数据源自13台机器人持续17个月采集的 超13万条任务片段。该研究开创性地将Transformer的应用向前推进——将语言和视觉观测到机器人动作的映射视为一个序列建模问题,并利用 Transformer学习这一映射。

RT-1执行闭环控制,并以3Hz的频率持续输出动作指令,直至触发"终止"动作或达到预设时间步上限。首先通过ImageNet预训练的卷积网络 Efficient Net处理图像,该网络通过FiLM模块与指令的预训练嵌入向量进行条件调节;随后采用令牌学习器(token Learner)生成紧凑令牌集 (set of tokens);最终由Transformer对这些令牌执行注意力计算,输出离散化动作令牌(action token)。

RT1限制:RT1是纯low-level controller的任务,训练的时候不会从互联网规模的丰富语义知识中受益,机器人控制数据成本高,数据集小 (130k),模型泛化性能差模型参数量少(35M),无法具有理解和推理能力。

谷歌DeepMind RT-2:单模型端到端架构

与RT-1关注模型的泛化能力相比,RT-2的目标是训练一个学习机器人观测到动作的端到端模型,且能够利用大规模预训练视觉语言模型的益处。 RT-1是利用预训练模型对视觉与语言进行编码,然后再通过解码器输出动作。与之不同,RT-2把语言、动作、图片放在一个统一的输出空间, 利用VLMs产生语言,也可以理解为“动作”为特殊的语言。总的来说,RT-2分为两步:首先对VLMs在大规模互联网数据进行预训练,然后在 机器人任务上微调。

在已见任务上,RT-2与RT-1表现相近,而其他基线模型的成功率较低。在未见任务上,两种RT-2模型整体泛化能力表现相近,但两者都明显优 于其它基线模型,较次优的两个基线模型(RT-1和MOO)实现了约2倍的性能提升,较其他基线模型(VC-1和R3M)提升约6倍。

RT-2限制:1)可以执行更加复杂的指令,但是不能泛化到新的行为上,因为网络上获取的数据只能帮助模型学会更多的视觉语义信息,无法学 会新的行为;2)由于机器人数据集总体量级很少,并且无法搜集机器人没有做过的行为;3)可以从人类行为的视频中提取数据;4)无法实时 推理:机器人控制模型需要模型能够实时推理,RT-2参数量太大,无法实时推理。

编辑:火腿肠
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至