2025年人形机器人行业专题报告:Sim to Real,具身大模型的问题、现状与投资机会

  • 来源:国海证券
  • 发布时间:2025/11/11
  • 浏览次数:268
  • 举报
相关深度报告REPORTS

人形机器人行业专题报告:Sim to Real,具身大模型的问题、现状与投资机会.pdf

人形机器人行业专题报告:SimtoReal,具身大模型的问题、现状与投资机会。本篇报告研究了以下核心问题:1、大模型的问题:我们对大模型的相关概念进行了释义和逻辑解读,认为LLM-VLM-VLA是具身智能发展的进阶路径,需要实现大模型从语义理解到物理世界理解的“具身”化、适应不同环境和任务的通用泛化,在实现的过程中,面临商业化落地的精度取舍和数据缺乏的瓶颈;2、梳理了部分布局者的大模型及本体进展,对比本体厂、大厂和独角兽公司的大模型技术路径及进展,包括银河通用、智元、FigureAI、优必选和PhysicalIntelligencePI;3、投资机会:我们认为,数采工具...

一 、模型的问题:大模型的概念、需求及瓶颈

概念的解读

我们认为,从基于海量文本生成的语言模型LLM-理解图像+文本的VLM多模型模型到应用于具身智能机器人的VLA模型,大模型呈现逐步进阶的特征,从文本language和图像vision的理解、逻辑推理到应用于物理世界的动作action,VLA模型使大模型迈入sim2real的阶段。

由于VLM具有多模态特征,可以延伸为【多】种可选【模态】的组合创新,如智元的ViLLA模型,在VLA模型基础上引入了+MoE混合专家模型,MoE中的Latent Planner(隐式规划器)借助大量跨本体和人类操作视频数据获得通用的动作理解能力,MoE中的ActionExpert(动作专家)借助百万真机数据获得动作执行能力。

端到端(End-to-End):简单理解,就像动物的大脑,从“看到的图像”和“听到的指令”直接推理出“怎么走”,中间不需要人为拆分多个步骤。传统机器人通常以“指令理解→环境感知→目标识别→路径规划”模块化的形式单独处理分解的子任务,有的甚至还要对工作环境提前构建地图;端到端能够实现看到图像-听到指令-直接推理,不需要人为拆分。

具身的需求

Moravec’s paradox:对于人工智能来说,赢得国际象棋比赛或发现新药属于容易解决的问题,但折叠衬衫或收拾餐桌却需要攻克人类有史以来最棘手的工程难题。因此,需要使人工智能系统具有“具身化”特征,使其能够获得物理智能physical intelligence。

具身大模型对比LLM的相似之处:具身模型基于广泛多元的数据进行训练,能够执行各类文本指令;对比LLM的不同之处:具身智能模型需要能同时处理图像、文本和动作,并通过机器人实体经验的训练获取物理智能——借助创新架构,学会直接输出低级运动指令,并在不同形态的机器人上应用。

具身大模型需要具备的条件: 1)统一一个模型泛化多种任务和环境:通过构建一个统一的原生模型,融合视觉、语言、触觉和身体姿态等全模态信息,实现对不同任务和环境的泛化能力。此外,通过不同任务之间的数据共享和迁移,能够进一步提升模型的泛化能力。 2)端到端:从接收全模态数据,到生成最终输出(如决策、动作等)的整个过程,通过一个简洁的神经网络链路完成。该过程无需人为设计特征、预编程或干预处理步骤,使得具身智能体能够实时适应不同任务和环境,显著提升灵活性与开发效率。3)Scaling up(规模化):真正的统一的端到端算法才允许模型通过持续的数据积累实现自我完善,使得具身大模型在数据量指数级增长的同时,不仅提升性能,还能在未知任务中展现卓越的自适应和泛化能力。

泛化的需求

我们认为,在具身智能领域,机器人的落地难点在于:不仅能够完成单一任务,还能像人类一样灵活适应多样化场景,尤其是在涉及机器人灵巧操作的任务时,能够让机器人实现准确、高效的复杂动作执行。解决这一问题的关键,是构建具有泛化能力的机器人策略模型,使机器人能够从大规模数据中学习,理解物理世界的复杂性,并精准执行各类任务。

泛化大模型VS. 垂域模型: 资料来源:physical intelligence官网,国海证券研究所 随着大模型技术逐渐度过“尝鲜期”,开始加速深入各类业务场景之中,B端市场毫无疑问成为了大语言模型技术的主战场。随着数字化转型的逐渐深入,B端企业在发展的过程中积累了大量行业与业务数据,而这些数据也成为了垂直领域大模型在B端企业落地生根的“沃土”。

数据的需求

好的具身智能产品可以被狭义定义为【数据驱动】型,需要解决的核心问题包括: 资料来源:星海图公众号,国海证券研究所 1)泛化需求VS精度需求:我们认为精度要求不高的垂直场景可能最先实现商业化:数据驱动的核心优势是泛化、劣势是精度,因此可以寻找对泛化能力要求迫切,但对于精度要求不过高的任务进行产品化; 2)自动驾驶VS具身智能,具身大模型泛化面临数据缺乏、获取数据成本高的问题。如果数据完全来自于遥操作,那么就会面临速成但不泛化的问题,特斯拉FSD的一个护城河就是其上百万台车和上亿小时的实时驾驶数据。如果没有数据来源,或者数据采集成本很高,那么产品未来的商业化面临较难的落地瓶颈。

我们认为,目前,各公司获得数据的方式包括:1)工厂等实训场景收集数据集;2)真机操作数据;3)视频数据;4)互联网规模数据等,并有不同数据集和预训练、后训练的数据组合。

二、布局者的问题:本体厂/大厂/独角兽,具身智能模型进展如何?

千寻智能:泛化大模型+数据高效率使用

两个实现的关键条件: 1)动作在相对末端执行器空间中表示: 模型根据输入预测当前末端执行器应该进行的相对移动,例如向 x 方向移动 1 厘米,而不是直接预测末端执行器相对于机器人本体的具体位置。这样的表示 方式可以让策略更专注于动作的相对变化,而不是依赖精确的全局位置信息。 .2)确保视觉输入能够覆盖任务所需的完整观察范围,即完整的任 务观察: 任务中所有的物体信息必须全部由视觉输入提供,为机器人的末端执行器配备 更广阔的视野。

Physical intelligence: π 0到π 0.5,将通用AI带入现实世界

底层逻辑:基于预训练视觉-语言模型(VLM) 骨干网络backbone和流匹配模型(Flow Matching) 的新型架构,能将互联网规模的语义知识与多机器人具身数据相结合,从而大幅提升机器人学习的能力。

在实现执行敏捷或灵巧操作后,机器人学面临更大的问题是“概括”:弄清楚如何在新环境或新物体中正确执行简单任务的能力。如,家庭打扫用机器人:每个家都是不同的,在不同的地方有不同的物体。概括必须在低-中-高多个层面上发生,实现对物理-视觉-语义的概括理解,并且面临较严重的数据缺乏的问题。 在低层,机器人必须知道如何拿起勺子(通过手柄)或盘子(通过边缘),即使它以前没有见过这些特定的勺子或盘子,即使它们被放在一堆脏盘子里。在更高层次上,机器人必须了解每项任务的语义——把衣服和鞋子放在哪里(最好放在洗衣篮或壁橱里,而不是在床上),以及什么样的工具适合擦拭溢出物。这种概括既需要强大的身体技能和对环境的常识性理解,这样机器人就可以同时在许多层面上进行概括,从物理、视觉到语义。此类机器人系统的多样化数据有限,这变得更加困难。

三、投资机会:数采工具+垂域场景或可落地先行

数据需求与泛化迁移:哪些环节能尽快落地?

根据各家大模型的进展,我们认为,目前大模型的瓶颈在于:1)数据缺乏;2)从训练数据到真实场景操作的泛化迁移。其中: 1)数据缺乏对应板块投资机会在于硬件、场景应用和数采需求,硬件方面,我们认为落地节奏较快的机器人本体形态可能为全向底盘移动+双臂夹爪; 2)泛化性方面:我们认为泛化性落地一定程度上指导具身智能商业化应用的落地节奏,具身智能率先落地的环节或在垂直行业,即能够获得大量被动训练数据的行业场景,如智慧仓储物流、环卫、缝纫等。

开发数采工具:汉威科技&南山智尚

我们认为部分厂商通过开发便捷易用、性价比较高的数采工具,解决目前具身大模型构建的数据缺乏、真机采集数据成本高的问题。

汉威科技:开发基于弹性传感技术的柔性可穿戴动捕服,目前正积极与多家机器人厂商进行合作交流。

公司目前正在开发基于弹性传感技术的柔性可穿戴动捕服,可将捕捉到的人体运动数据实时传输至机器人系统,用于动作示范、训练学习甚至远程操控,为机器人动作训练提供了全新的解决方案,目前正积极与多家机器人厂商进行合作交流;通过收购韧和科技约27%股权,布局弹性拉伸传感器等产品。韧和科技目前的弹性拉伸传感器可用于智能穿戴设备(动捕、医疗用呼吸带、医疗康复用数据手套等)和智能纺织品(可用于自动调节温度和生理指标监测等)。

南山智尚:发布织物触觉智能手套等。

发布织物触觉智能手套,该手套融合柔性传感、感驱一体纤维等多项创新技术,在构造上实现“感知-驱动-处理”的高度集成,可应用于灵巧手遥操作、数据采集及虚拟现实(VR)等场景; 根据山东南山智尚科技股份有限公司公众号资讯,公司已建成3600吨超高分子量聚乙烯纤维智能产线和8万吨高性能差别化锦纶长丝产线,可为人形机器人批量供应高耐久、高可靠的传动腱绳和电子皮肤材料,满足未来百万台级的产能需求。

拓展垂域场景:AMR仓储无人化+极智嘉

推出具身智能基座:推出全新通用机械臂操作技术方案及全球首个仓储场景专用具身智能基座模型Ceek+ Brain,破解仓储超大规模商品拣选难题,可实现无需物品先验模型、本地化模型部署、准确性和效率实现较大幅度提升等。成立具身智能子公司:该子公司将聚焦机械手拣货、通用机器人等具身智能技术研发和相关产品业务,目标场景为物流和制造等,将与公司现有物流机器人业务紧密协同,并借助于现有的品牌和业务网络快速推进技术和产品的广泛商用。 打造通用仓储机器人:公司规划节奏为:1)当前为单点突破期,以货品拣取场景作为首站,实现真无人拣选;2)场景通用期:拓展至搬运、打包等环节,向通用性演进;3)生态期共:建构建模型生态,促使模型资源不断丰富,致力于成为全球仓储具身智能生态主导者。

拓展垂域场景:智慧环卫+劲旅环境

落地场景:无人环卫车的应用场景预计率先落地封闭和半封闭场景,原因是相较于开放道路环境较长的审批流程,这类场景部署快、安全性高。 行业空间:根据公司公告,当前行业正处于从试点示范向规模化过渡的关键阶段,无人环卫市场呈现较快增长态势。截至2025年上半年,无人环卫项目数量已突破百个,市场渗透率得以明显提升。 公司进展:公司自主研发的无人环卫设备已开始面向外部市场销售,产品涵盖从0.5吨以下到2吨以上的全系列小型、中型、大型洗扫车,以适配不同作业场景,后续加快产品更新换代,降低成本,尽快推出第三代全面自研智驾产品;短期内有望通过结合服务业务快速推广落地,抢占市场份额,通过承接项目来快速部署无人设备;重点研发捡拾机器人,将机器人智能与无人驾驶技术相结合,应用于室外及园林绿化中零星垃圾的捡拾场景。

拓展垂域场景:服装智能制造+杰克科技

根据上证e互动,杰克科技计划于2026年下半年推出面向服装智造场景的人形机器人,通过与智能模板机、自动机等品类的有效结合,破解“招工难、效率提升与柔性生产”等服装行业痛点,推动服装产业智能化升级。  场景应用:我们认为,公司可基于对服装制造环节的深度理解和软硬件全方位一体的经验,实现人形机器人在垂直场景的实际落地应用。2026年发布的人形机器人会先在部分环节进行切入,通过与智能模板机、自动机等品类的有效结合,破解“招工难、效率提升与柔性生产”等服装行业痛点,推动服装产业智能化升级。 艾图AI缝纫机发布:据台州市企业联合会公众号资讯,为建立起缝纫经验垂直模型,艾图与多家头部服企联合创新,收集了100万小时的手势特征数据,建立缝纫经验垂直模型,形成“感知—分析—决策”的智能闭环,进而帮助工厂将培训周期缩短60%,助力车工提升效率8%-15%。

报告节选:

编辑:火腿肠
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至