2025年机械行业深度报告:机器人软硬件加速迭代,产业化落地可期

  • 来源:方正证券
  • 发布时间:2025/09/04
  • 浏览次数:209
  • 举报
相关深度报告REPORTS

机械行业深度报告:机器人软硬件加速迭代,产业化落地可期.pdf

机械行业深度报告:机器人软硬件加速迭代,产业化落地可期。机器人应用场景多元,市场空间广阔。随着技术的进步,预计未来人形机器人将在广泛的场景中实现商业化应用,不仅提升生产效率,还将在教育和家庭生活中扮演更加积极的角色。据前瞻产业研究院预测,到2029年全球和国内人形机器人产业规模将分别达到324亿美元、750亿元人民币。特斯拉OptimusGen3将于2026年量产,重视供应链投资机会。2025年7月,马斯克表示:Optimus已完成第三代(V3)版本的核心设计,2026年投入量产。预计特斯拉Optimus迭代方向:身体和灵巧手自由度增加,轻量化材料用量提升,灵巧手感知和运动能力提升。同海外典型...

第一章:人形机器人行业概览

人形机器人介绍和结构

人形机器人是机器人从专用到通用场景的升级。人形机器人具备大脑、小脑、机械臂、灵巧手等关键部件,实现对环境的感 知交互、运动控制、任务执行等,且执行关节的不断优化,使其负载能力、精准度不断提升,商用性能进一步提高。 人形机器人是具备自主行动能力的智能机器人。以双腿行走的方式,通过手臂和身体的协调完成功能,基于通用型算法和生 成式AI,具备语义理解、人机交互、自主决策等能力,并利用人机交互实现任务理解与反馈,需要强大的感知计算与运动控 制能力。

人口老龄化加速人形机器人发展

老龄化与人口红利减弱成为行业发展的主要需求因素。中国65岁及以上人口比重逐年提高,2024年达到15.6%,净增347万 人;2024年全国规模以上企业就业人员平均工资为10.25万元。 根据前瞻产业研究院预测,2025年中国劳动力供给缺口为600万人,到2030年将达到2000万人。预计2030年欧盟、美国、日 本、韩国的劳动力缺口分别为1650、650、644、380万人。人形机器人是缓解制造业人力供需矛盾的关键一环,需求量有望 快速增长。

人形机器人的应用场景分类

人形机器人应用主要受技术能力与场景空间的影响。从场景的结构化程度看,结构化程度越高,对技术性能要求越高,则技 术壁垒越高,例如:精细制造、应急救援等。从场景的广度,覆盖范围越广,市场空间越大,例如:物料搬运、护理按摩等。 预计人形机器人在To B的细分市场率先商业化,如商场导购、物料搬运、养老护理等,初期功能单一,后逐步成熟转为通用 型机器人,由To B转为To C,服务广大家庭用户。

人形机器人产业规模预测

随着技术的进步,预计未来人形机器人将在更多场景中实现商业化应用,不仅提升生产效率,还将在教育和家庭生活中 扮演更加积极的角色。 根据前瞻产业研究院预测,到2029年全球和国内的人形机器人产业规模将分别达到324亿美元、750亿元人民币。

人形机器人产业链构成

人形机器人产业链基本形成。1)上游是电机、减速器等核心零部件,和摄像头、轴承等其他零部件。2)中游是人形机 器人本体制造,包括主要模块、内置的算法模型与系统、主要组成部分。3)下游是系统集成、产品销售与维修保养。 人形机器人上游核心零部件中,行星滚柱丝杠价值量占比较高。根据特斯拉 AI Day和前瞻产业研究院资料,预计到2030 年,行星滚柱丝杠在人形机器人价值量占比为19%,无框力矩电机、减速器、力传感器、空心杯电机的占比预计分别为 16%、13%、11%、8%。

第二章:特斯拉Optimus发展进程及展望

特斯拉机器人发展历程

特斯拉Optimus经过三次主要迭代,预计V3于2025Q4定型。

特斯拉机器人代际变化

特斯拉Optimus迭代方向:自由度增加,轻量化,灵巧手。 同海外典型机器人对比:Optimus自由度更多,步行速度快,成本相对较低。

Optimus Gen2的核心零部件构成及成本占比

身体:直线关节用电机+行星滚柱丝杠,旋转关节用电机+谐波减速器(后续可能会用摆线针轮)。 灵巧手:第三代都是直线关节,用电机+微型滚珠丝杠,电机用空心杯或者无刷直流。 成本占比:预计电机和丝杠各占20%,减速器占13%。

特斯拉机器人灵巧手的迭代

特斯拉Optimus灵巧手迭代:自由度增加,抓取能力和精度提升,执行器后置。

特斯拉机器人轻量化材料的迭代

从传统轻金属+普通工程塑料向高性能复合材料的跨越。第一代以铝合金骨架结合塑料外壳,实现了基本的轻量化;第二代 大胆引入了以PEEK为代表的新材料,在保证强度的同时将重量大幅降低,并由此带来了运动能力、能效和平衡性的显著提升。 得益于重量下降,Optimus Gen-2的运动性能明显提高。官方演示视频显示其行走速度提高了30%,平衡性和全身控制力也有 所提升。PEEK材料本身密度仅约1.3 g/cm³,约为铝合金的一半,却具有出色的力学强度和刚性。

特斯拉Optimus换帅,新任负责人深耕自动驾驶算法

米兰:Kovac 无论是从过去的履历,还是从在特斯拉的经历来看,都是偏向工程化的人才。特斯拉 Optimus 的核心团队, 工程化和硬件相关的同事几乎都是从特斯拉汽车团队来的。 阿肖克:是软件算法背景出身。在2025年5月的一次访谈中,埃卢斯瓦米阐述了特斯拉Optimus未来的发展路径:当前阶段以 动作捕捉为主,未来通过观看 YouTube 教程进行学习,并实现自我导向式学习。

GEN 3将于2025Q4定型,2026年开始规模化量产

2025年初,全年生产5000台,乐观情况下甚至达到1万台。 2025年6月,减少了Optimus零部件采购,正集中精力解决软硬件技术问题。据媒体报道,截至2025年5月底,采购量仅支撑 约1200台机器人。 2025年7月下旬:特斯拉机器人6-9月批订单交付开始陆续恢复。马斯克表示:Optimus已完成第三代(V3)版本的核心设计, 2026年投入量产。

第三章:国内主要本体厂进展

国内机器人相关政策梳理

日本、欧美等发达国家早期出台机器人产业政策较多,中国则是近年来飞 速发展,出台了一系列政策支持人形机器人产业的发展。 中国人形机器人政策重心由技术开始转向产业化。2021年之后陆续发布 《“十四五”机器人产业发展规划》、《“十四五”智能制造发展规划》、 《“机器人+”应用行动实施方案》、《关于深入实施“人工智能+”行动 的意见》等政策。

2025H1国内机器人中标情况

人形机器人场景应用联盟统计,2025年上半年国内公开披露的中 标项目已超过83个,合同金额近3.3亿元。

7月,中国移动采购与招标网信息,智元机器人与宇树科技中标中移(杭州)信息技术有限公司的人形双足机器人代 工服务采购项目,总预算高达1.24亿元(含税),创下国内人形机器人公开的最大单笔招标金额。 普智机器人与一家智能制造公司签订了2825万元的人形机器人产品销售框架合同,将供应50台人形机器人,单台售价 约56.5万元。 优必选中标觅亿(上海)汽车科技有限公司总额9051.15万元的机器人设备采购项目。 8月,智元机器人与富临精工达成数千万元合作,近百台远征A2-W(轮式通用机器人)将进入汽车零部件工厂。

第四章:人形机器人大模型展望

人形机器人智能化处于L2-L3过渡阶段

《人形机器人分类分级应用指南》从结构外观、移动方式、智能模型等方面进行指导分类,按照具身智能、下肢运动、上肢 作业、应用环境等作为分级要素,将人形机器人划分为 L1-L4 四个技术等级。 过去十年,AI模型从单一模态一步步走向融合。VLA模型的发展深深植根于计算机视觉(CV)、自然语言处理(NLP)和强化 学习(RL)这三大领域的历史积淀。

VLA模型的架构和演变过程

VLA模型的工作流程:它接收状态(State)(如摄像头捕捉的图像)和指令(Instruction)(如用户的语言命令)作为 输入,通过视觉编码器和语言编码器进行处理,最终由动作解码器(Action Decoder)生成机器人需要执行的动作 (Action)。整个系统还与强化学习、世界模型等重要相关技术紧密相连。

PI大模型的迭代

2024年10月,Physical Intelligence(PI)正式发布机器人 领域端到端视觉-语言-动作(VLA)模型π0。2025年2月,PI 开源了基础版π0与快速推理版π0-FAST。 2025年4月,Physical Intelligence(PI)发布新一代π0.5 模型,旨在提升机器人泛化能力。

Figure AI的Helix模型

2025年2月,Figure AI发布了通用具身基础模型Helix ,该模型采用双系统架构:系统S1(快思考系统)+ 系统S2 (慢思考系统)。 S1系统:一个80M参数规模的Transformer模型,依赖一个完全卷积的多尺度视觉骨干网络进行视觉处理。系统以 200Hz的频率输出完整的上半 身人形控制,包括期望的手腕姿态、手指弯曲和外展控制,以及躯干和头部方向目标。 S2系统:一个7B参数规模的预训练VLM模型,处理机器人单目视觉图像和机器人状态信息(包括手腕姿态和手指位置),并将它们投影到视觉 语言嵌入空间中。系统将所有语义任务相关信息提炼为一个连续的潜在向量,以7-9 Hz的频率传递给 S1系统 ,为机器人的行为决策提供高层 次的指导。

特斯拉Optimus大模型

Optimus沿用了特斯拉汽车 FSD(完全自动驾驶)系统的技术栈,采用的是端到端的大模型路线。自研的多模态大模型架构, 既能处理摄像头、雷达等视觉数据,也能理解动作、语言,甚至具备一定的规划和推理能力。 Optimus的能力迭代:V1像个慢动作人偶,刚学走路;V2开始拎水瓶、分拣物品、能稳定双足行走;V2.5动作自然、抓取精 准,甚至在工厂里上岗干活,变化的核心在于接入 FSD 那套“统一大脑”,拥有:感知现实世界的视觉能力,简单语言和 语义理解能力,对空间位置的建模与规划能力。 训练数据: 1)前期:极其依赖真实世界数据,包括定制远程操作系统、动作捕捉、计算机视觉和 VR 模拟来训练机器人行为;还会从 网络视频中提取行为知识,实现 “零样本学习” 和 “迁移学习”,提升机器人在新任务中的部署速度。 2)25年5月份,Optimus学习了更多技能,如炒菜、倒垃圾、拉窗帘、放置零件等。根据demo视频和前负责人Milan Kovac介 绍,Optimus已经可以通过学习第一视角的视频数据学习新的技能。 3)25年6月,据外媒报道,Optimus开始聚焦纯视频数据驱动的AI训练框架。这一变革由新任项目负责人、AI主管阿肖 克·埃卢斯瓦米主导。 4)策略转变后,工人不再穿戴动作捕捉服,而是戴着头盔和沉重的背包,背包上安装了特斯拉自研的五个摄像头。这些摄 像头朝向各个方向,能为 AI 提供空间定位信息,精确捕捉手部和关节的细节动作。 5)马斯克更预言Optimus未来可通过YouTube视频自学。 训练方式改变的好处: 1)旧训练体系存在瓶颈:单是工厂动作训练就需超50万小时数据收集,成本高达5亿美元,且故障频发拖累进度。 2)视频训练可通过头盔+背包式多角度摄像系统,高效捕捉关节运动细节,数据采集速度提升10倍。

国内外典型的VLA大模型

智元启元大模型:由VLM(视觉-语言多模态大模型) + MoE(混合专家)组成。其中,MoE包含混合专家(隐式规划器)和混 合专家2(动作专家)两部分组成。 星动纪元ERA-42:2024年12月,星动纪元推出端到端原生机器人大模型ERA-42。该模型采用高层次规划和低层次控制的双 系统架构。 银河通用GraspVLA:由一个自回归视觉语言骨干网络(VLM)和一个基于流匹配的动作专家模型组成,两个模块通过渐进 式动作生成(PAG)机制连接。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至