2025年人形机器人“醍醐灌顶”走向AGI:从硬件1.0走向智能交互2.0时代,车企技术同源与工业场景优势明显,感知与灵巧手互动物理世界
- 来源:方正证券
- 发布时间:2025/03/11
- 浏览次数:533
- 举报
人形机器人“醍醐灌顶”走向AGI:从硬件1.0走向智能交互2.0时代,车企技术同源与工业场景优势明显,感知与灵巧手互动物理世界.pdf
人形机器人“醍醐灌顶”走向AGI:从硬件1.0走向智能交互2.0时代,车企技术同源与工业场景优势明显,感知与灵巧手互动物理世界。人形机器人发展突破路径明晰,与物理数据世界基础模型模型结合的视觉语言动作端到端大模型VLA是目前人型机器人走向AGI的解决方案;美国Figure发布端到端VLA大模型Helix实现机器人多业务协同突破;智元机器人将于3月10日正式发布首个通用具身基座模型——智元启元大模型,将集合采训推一体,小样本快速泛化、“一脑多形”的跨本体应用、持续进化、人类视频学习等能力。Helix是一个通用的视觉-语言-动...
1. Figure端到端VLA大模型Helix,赋能机器人进入感知交互时代
Figure发布Helix,突破人形机器人瓶颈
Helix突破瓶颈,成功适配家庭环境。距离与OpenAI分道扬镳不到一个月,Figure公司于2025年2月20日正式发布了新一代 Helix大模型。在此前,家庭环境是机器人技术面临的最大挑战,与可控的工业环境差异显著。家庭场景中存在大量多类、多 性质的物品,例如易碎的玻璃器皿、褶皱的衣物、散落的玩具等,其形状、尺寸、颜色和质地都具有不可预测性,导致机器人 难以在家庭中发挥有效作用。为了让机器人在家庭中发挥作用,它们需要能够按需生成智能的新行为。人工智能的其他领域已 经掌握了这种即时泛化的能力,但如何将视觉-语言模型(VLM)中捕获的丰富语义知识直接转化为可泛化的机器人控制,成为 将机器人技术扩展到家庭环境中的一大挑战。而Helix是一个通用的视觉-语言-动作(VLA)模型,它统一了感知、语言理解 和学习控制,克服了机器人技术中的多个长期挑战。
Helix达成多个行业首创,引领人形机器人走向感知交互时代
Helix 在多个重要方面成功实现了行业首创,为机器人领域的发展树立了新的标杆。
高速连续控制:Helix是首个能够以高达200Hz的高频率对人形机器人的整个上半身进行连续控制的VLA。其控制范围极为 全面,涵盖了手腕、躯干、头部乃至每个手指的灵巧动作。如此精细化且高频的控制,为机器人赋予了前所未有的灵活性 和操作精度,这使得机器人能够更好地适应各种复杂的任务和环境。
多机协作:Helix 首次实现了两个机器人同时运行同一模型,并且能够协作完成涉及陌生物体的长时段任务。这种多机器 人协作的能力,不仅拓展了机器人在实际应用中的功能,还为一些需要多人协作完成的复杂任务提供了新的解决方案,例 如在物流仓库中协同搬运货物、在灾难救援现场共同完成搜索和救援任务等。
配备了 Helix 的 Figure 机器人具有强大的物体抓取能力。它能够仅仅依据自然语言指令,就抓取任何小型家用物体,甚 至包括数千种在其训练过程中从未出现过的陌生物品。这一能力的实现,得益于 Helix 对自然语言的精准理解以及对视觉 信息的高效处理,使得机器人能够迅速分析物体的特征和位置,并规划出合适的抓取动作,极大地提高了机器人在家庭环 境以及其他场景中的实用性。
单一组神经网络权重:Helix 仅使用单一组神经网络权重,便能够轻松应对诸如多机器人交互等多种复杂行为,并且在这 个过程中无需针对任何特定任务进行额外的微调。传统的机器人控制模型往往需要针对不同的任务分别训练不同的模型, 这不仅耗费大量的时间和计算资源,而且在实际应用中缺乏灵活性。而 Helix 的这种创新设计,使得它能够凭借一套通用 的神经网络权重,快速适应各种不同的任务需求,大大提高了模型的通用性和效率。
Helix便于商业化部署。Helix 在技术实现上具有显著的商业应用优势,它是首个完全在嵌入式低功耗 GPU 上运行的 VLA。 这一特性使得它无需依赖高端且昂贵的设备,即可直接投入商业应用。嵌入式低功耗 GPU 的使用,不仅降低了硬件成本, 还提高了设备的便携性和稳定性。这意味着在实际的商业场景中,无论是在家庭服务机器人、工业生产辅助机器人还是其 他领域的应用中,都能够以较低的成本部署 Helix 模型,为机器人的商业化推广和广泛应用提供了有力的支持。
Helix核心运行原理:数据处理、训练与推理部署
Figure 收集多机器人、多操作员高质量数据集,构建严谨的数据处理与利用流程。 Figure收集了一个高质量的多机器人、多操作员数据集,其中包含各种远程操控行为的数据,总量约为500小时。为了生成 以自然语言为条件的训练数据对,Figure使用了一个自动标注的视觉语言模型(VLM)来生成事后指令。这个视觉语言模型处 理来自机器人机载摄像头的分段视频片段,并给出提示:“你原本会给机器人下达怎样的指令,才能让它做出这段视频中展示 的动作呢?” 为了防止数据污染,所有在训练过程中处理过的物品都不会用于评估。
Figure采用端到端模式训练Helix。 Helix采用完全端到端的方式进行训练,通过标准的回归损失函数,将原始像素和文本指令映射为连续动作。梯度通过用于 指导S1行为的潜在通信向量从S1反向传播到S2,从而实现两个组件的联合优化。Helix不需要针对特定任务进行调整;它保持 单一的训练阶段和一组神经网络权重,无需单独的动作头或针对每个任务的微调阶段。在训练过程中,Figure在S1和S2的输入 之间添加了一个时间偏移。这个偏移量经过校准,以匹配S1和S2在部署时的推理延迟差距,确保在训练中准确反映部署时的实 时控制要求。
Helix的训练设计使其能在配备双低功耗嵌入式GPU的Figure机器人上进行高效的模型并行部署。推理流程在S2(高级潜在 规划)和S1(低级控制)模型之间进行拆分,每个模型都在专用的GPU上运行。S2作为一个异步后台进程运行,处理最新的观 测数据(来自机载摄像头和机器人状态)以及自然语言指令。它不断更新一个共享内存中的潜在向量,该向量对高级行为意图 进行编码。S1作为一个单独的实时进程运行,维持着流畅的上半身整体动作所需的关键200赫兹控制循环。它同时接收最新的 观测数据和最新的S2潜在向量。S2和S1推理速度的固有差异自然使得S1在处理机器人观测数据时具有更高的时间分辨率,从而 为反应式控制创建了一个更紧密的反馈循环。这种部署策略特意模仿了训练中引入的时间偏移,以最小化训练和推理之间的分 布差异。异步执行模型允许两个进程以各自的最佳频率运行,使我们能够以与最快的单任务模仿学习策略相同的速度运行 Helix。
2. 智能驾驶端到端模型可迁移至具身智能,众多车企纷纷布局
汽车智能驾驶端到端模型可迁移至具身智能,均强调模型的泛化能力
传统自动驾驶系统采用模块化串联,存在信息传递损耗及延迟等问题。传统智能驾驶方案核心模块分为感知、定位、预测、决策和控制等,在模块上 的划分使得每个模块的独立开发更加容易,在进行问题追溯时也更加简单快速。但传统方案面临每个模块的输入通常来源于前一传递过程中可能出现 的损耗、计算延迟以及累积误差等问题,限制了模块及整个系统所能达到的灵活性和泛化性的上限。 端到端架构强调感知信息无损传递、可以实现自动驾驶系统的全局优化。车端智能驾驶系统朝端到端架构演进,与具身智能具有通用性。端到端模块 化自动驾驶的核心在于不同子模型在各个模块中的嵌套与协同工作,随着Transformer架构等先进算的发展,模型间的界限正逐渐变得模糊。原本独 立的子任务模型正逐步被更大规模的神经网络模型所取代,不断提升系统的能力上限。根据CSDN,VLA(Vision Language Action)具备高度的通用 性,由于它是建立在一个通用的大规模预训练基础上,理论上具身智能经过微调后都可以使用相应算法。
大模型提升泛化能力,辅助端到端架构应用于具身智能领域
对于车端而言,大模型可提升智能驾驶泛化能力,辅助端到端架构逐步上车。大模型并非是实现端到端的必要条件,端到端的最终目的是让车辆能够 自主导航并安全行驶,而大模型为端到端实现提供了优良的可选方案。大型语言模型、大型视觉模型以及多模态大模型等基础模型可通过预训练获得 智驾相关的推理能力和丰富的知识,用于升级传统的基于规则的if-else系统。其出色的泛化能力能够应对自动驾驶技术发展中的挑战,提升在感知、 预测、规划等关键领域的性能,升级自动驾驶仿真和测试环节的技术手段。 对于机器人而言,大语言模型是人形机器人“大脑”实现智能化的关键。在人形机器人的应用中,大模型集成了多模态的感知模块,这些模型在自然 语言处理、计算机视觉、语音识别等领域展现出强大的语义理解、逻辑推理以及多模态学习等能力。结合端到端方案可直接处理多模态传感器输入并 生成运动控制指令,打通了感知到控制的全流程,被视为人形机器人应用大模型的潜在主流技术路线,端到端架构与大模型的深度融合,有望推动人 形机器人系统向更高水平的鲁棒性、效能和灵活性演进,显著增强其复杂环境适应能力与任务执行效率。
车企跨界竞速,机器人赛道开启 “狂飙” 模式
小鹏汽车于2024年11月6日在AI科技日上发布了新一代人形机器人Iron。Iron的设计采用了高度仿人结构,身高178厘米,体重70公斤,拥有62个 主动自由度,其双手按照1:1人类双手尺寸设计,具备15个自由度,并支持触觉反馈,能够进行精细的操作和交互。Iron搭载了图灵AI芯片,算 力高达3000T,能够支持复杂的语言理解和逻辑推理,使其在智能交互方面表现出色。此外,Iron配备了先进的AI鹰眼视觉系统,可实现720°无 死角感知环境,确保其在复杂场景下的高效导航和操作。在运动能力方面,Iron采用了端到端大模型和强化学习算法,使其行走更加自然流畅。 目前,Iron已在小鹏工厂的部分岗位上开始了“工作”实训,未来将优先应用于工厂的搬运、分拣等任务,并有望在门店中作为汽车顾问,为消 费者提供服务。
3. 众多类型传感器广泛应用于人形机器人,是实现智能化的核心部件
传感器是人形机器人实现智能化的必要部件
传感器是人形机器人的核心部件,是人形机器人实现智能化的必要部件。人形机器人传感器是安装在人形机器人上,用于感 知外部环境和自身状态的设备。感知是人形机器人控制和执行的前提。传感器是一种检测装置,能感受到被测量的信息,并能 将感受到的信息,按一定规律变换成为电信号或其他所需形式的信息输出,以满足信息的传输、处理、存储、显示、记录和控 制等要求。感知层的传感器是软件控制和硬件零部件的桥梁,是物理世界与数字世界的接口,是实现具身智能的关键。
人形机器人的传感器几乎遍布机器人全身。人形机器人传感器包括视觉传感器、惯性测量单元IMU、力/扭矩传感器、触觉传 感器、位置传感器、听觉传感器、温度传感器、电流传感器、气压传感器等。其中最主要的是力矩传感器、触觉传感器和视觉 传感器这三大传感器。
视觉传感器-捕捉信息的途径
机器人视觉传感器是指能够获取物体图像并将其转换为电信号,从而被机器人识别和分析的一类传感器。它主要由图像获取和 图像处理两个部分组成。图像获取部分负责捕捉物体的图像,而图像处理部分则负责将图像转换为可以被机器人理解的信息。
机器人视觉可分为二维(2D)和三维(3D)两大类。2D视觉技术主要处理平面图像,通过对二维图像的分析和理解来完成各 种任务,每个像素只捕获颜色值及灰度两项数据。3D视觉处理的对象是三维立体空间中的物体和场景。它不仅包含了在X和Y轴 上的空间信息,还包括在Z轴上的深度信息。
特斯拉与宇树分别为2D以及3D视觉 。 特斯拉:BEV + Transformer BEV 感知技术成为感知外部环境的标准方法。BEV 是 Bird’s Eye-View 的缩写,通过神经网络将多个摄像头和传感器收集的 信息进行整合,形成基于俯视角度的全景图,同时结合时序信息,动态地感知周围环境并输出结果,以便后续的预测和规划模 块使用。驾驶行为是在 3D 空间中的行为,BEV 通过将 2D 透视空间图像转换为3D 空间,消除了距离尺度和遮挡问题,使算法 能够直观地判断车辆在空间中的位置以及与其他障碍物的关系。Transformer 大模型为构建 BEV 空间提供了最佳解决方案。 BEV 空间的构建需要一种合适方法来实现目的,将多个 2D 图像和传感器信息综合转化为一个 3D 向量空间。特斯拉引入 Transformer 算法架构来执行这一转换,通过适应各种输入形式,使得 BEV 在自动驾驶领域得以实现。 宇树科技RGB-D立体视觉摄像头 利用深度摄像头(如激光雷达、ToF摄像头)帮助获取3D空间信息,使人形机器人能够识别周围环境中的物体行人和障碍物等, 实现避障和导航等功能。
4. 灵巧手:对外交互的核心硬件模块,新变化孕育新机会
灵巧手是人形机器人对外交互的重要窗口,包含驱动/传动/感知三大细分模块
灵巧手是末端执行器的细分品类,在训练数据易得性、环境适应性等方面更具优势,是人形机器人的重要组成部分。灵巧 手是典型的抓手类末端执行器,其形态和功能均类似人类手部,能够进行抓取、捏取等精细多样的操作,是人形机器人与外 界环境实现较好交互的重要窗口。 灵巧手的硬件模块包括三部分:驱动系统、传动系统及感知系统。驱动系统的核心作用是产生运动和力,传动系统将运动和 力从驱动系统传导至灵巧手各关节,感知系统提供灵巧手内部的运行状态及外部环境感知反馈。根据不同应用场景的特定需 求,在驱动结构、驱动方案、传动部件等方面存在多类不同方案。
灵巧手在一定边界条件下追求“灵巧性、抓握力、精度”的提升
灵巧手诞生自上世纪70年代,朝着多自由度、集成化、仿生化发展。灵巧手概念自20世纪70年代产生,随着计算机技术等领 域的发展,朝着集成化、智能化、灵巧化方向持续迭代。灵巧手应用广泛,已在医疗、航空航天、工业等领域实现应用。
报告节选:



- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 10 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 10 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
