2023年从谷歌看机器人大模型进展
- 来源:华鑫证券
- 发布时间:2023/11/20
- 浏览次数:705
- 举报
从谷歌看机器人大模型进展.pdf
从谷歌看机器人大模型进展。大模型是远期人形机器人的必备要素:人形机器人的特点在于通用性和泛化能力,远期可以替代人类完成多项任务。而大模型具有庞大的先验知识库与强大的通识理解能力,可以满足人形机器人通用性的场景要求和技能要求,不再仅限于完成某一类特定工作,而是进一步完成多类型任务。在机器人大模型上,思维链可以帮助机器人拆分与分解一件事件如何完成,先解码出计划的步骤,再解码需要完成任务需要输出的动作。谷歌:从Saycan到RT-X,软件领军者,步步为营,模型高速迭代从2022年4月谷歌推出Say-can模型,初次引入大模型用于做任务理解和拆分,到RT-1使用传统神经网络的方法来执行SayCan的任...
1.大模型是人形机器人的必备 要素
大模型是人形机器人的必备要素
长期来看,人形机器人的最大优势在于通用性: 人形机器人的特点在于泛化能力。如果只为解决单一或少数场景的应用,则特定专用机器人足以满足要求(如酒店服务机器 人,扫地机器人等),从第一性原理来说,机器人之所以拟人,其根本目的在于完成多样化的任务——能爬楼梯,能按电梯, 能提重物等完成所有人类所需的各种任务。
通用性的实现依赖大模型的应用(体现在感知与识别): 大模型具有庞大的先验知识库与强大的通识理解能力。可以满足人形机器人通用性的场景要求和技能要求。不再仅限于完成 某一类特定工作,而是进一步完成多类型任务。目前机器人的应用基础是代码,机器人工程师需要编写代码和规范来控制机 器人行为,这个调试过程缓慢、昂贵且低效,使用场景有限。ChatGPT带来一种新的机器人应用范式,我们可以通过LLM将 自然语言快速转换为代码。这样就可以解决大量的场景以及任务需求,有望大幅度降低了算法开发的复杂度,同时可以简化 合并算法模型数量,提升开发效率。而传统算法模型即使经历大量的训练,仍存在较多小概率场景(corner case)难以覆 盖,泛化能力较低。
人形机器人大模型所需的视频数据足够充足(体现在后续 的动作): 深度学习的本质是模仿,可以用大量的人类视频来进行预训练/模 仿学习,之后再通过标注用Reinforcement Learning进行微调。 机器人做成人形也是为大模型在机器人上的发展铺垫。
思维链条: 思维链(Chain of Thought,CoT)是一种思维工具,通过逐步延伸 和拓展一个主要想法,帮助人们进行更深层次的思考,并得出更复 杂、更全面的结论。在机器人大模型上,思维链可以帮助机器人拆 分与分解一件事件如何完成,增加了先解码出计划的步骤,再解码 需要完成任务需要输出的动作,在需要语义推理任务上效果更好。 在谷歌7月发布展示的具身大模型中RT-2中,机器人展示了类似视 觉语言模型(VLM)的思维链,如:选出与其他物品不同的物品; 告诉机器人很困,让机器人拿饮料,机器人会拿红牛;让机器人完 成锤钉子任务,但桌子上只有耳机线、石头、纸,使用思维链后机 器人会拿石头等。
2 谷歌机器人大模型进展
SayCan:谷歌机器人大模型的开端,连接LLM与具身智能
2022 年4月,谷歌推出 Say-can 模型。将任务拆分成两个部分,先是 “Say”,模型通过与谷歌的大语言模型结合, 把获得的任务进行分解,找到最适合当前行动;之后是“Can”,模型计算出当前机器人能够成功执行这一任务的概率。 机器人通过将二者结合起来,进行动作。例子:对机器人说“我的饮料撒了,你能帮助我吗”机器人会首先通过语言模型 进行任务规划,这时可能最合理的方式是找到一个清洁工、找到一个吸尘器,找一块海绵自己擦等。然后机器人会通过价 值函数计算出作为机器人,找到海绵自己擦是最佳方案。之后,机器人就会选择寻找海绵的动作。 • 亮点:首次引入大语言模型帮助理解任务,选择合适的任务规划。 • 不足:机器人的动作仍然是预设好的,因此只能完成特定任务。底层技能通用性和泛用性较差。只能输出高级指令。
RT-1:用于动作控制的端到端模型
原理:RT-1模型输入图片以及自然语言指令,通过基于image net(图像分类数据集)的高效卷积神经网络将其输出成 为一系列与图片中任务相关的token,通过特征学习器将其转换成压缩的图像特征(image token),经过Transformer模型 解码得到离散的动作指令。 • 亮点:将任务通过Saycan拆分成具体的任务,然后使用RT-1去执行。可以执行700个现实中文字指令,并且泛用到新的 任务中(可以在三个未见过的厨房执行任务)。可以接受图片作为输入。训练了宝贵的数据集供使用,使用13个机器人历 经17个月收集了超过13万个轨迹。端到端的控制模型。 • 不足:对新任务的泛化实际上是以前见过的案例,只能接受出现过的指令。本质上是模仿学习,无法超越数据集的遥操 作。严格意义上不是“大模型”,无法从互联网规模(internet-scale)数据中受益。
PaLM-E:多模态视觉语言具身大模型(VLM)
原理:由谷歌大语言模型PaLM与拥有220亿个参数的最大视觉模型ViT-22B结合而成,输入连续的视觉、状态、文字之 后,在已经预训练的大语言模型PaLM基础上进行端到端训练,用于多个具体任务,包括顺序机器人操作规划、视觉问题解 答和图像视频字幕描述。最终输出文本形式的高级任务指令(可以是问题的答案,也可以是PaLM-E以文本形式生成的一系 列决策,这些决策应由机器人执行)。 • 亮点:让机器人能够接收持续的多模态的输入(包括文本,图片,状态以及其他传感器模态),连续信息以类似于语言 标记的方式注入到语言模型中,并具有一定的推理能力。参数量级有明显提升,5620亿的参数模型。 • 不足:本质为大语言模型,对于动作的完成和指导较弱。只解决机器人的高级别指令,没有更基础层级的具体运动控制 相关指令。
RT-2:控制机器人的视觉 - 语言 - 动作(VLA)大模型
原理:机器人数据仍然稀缺的背景下,收集到海量机器人数据难度太大。因此谷歌RT-2抛弃了RT-1从头训练 Transformer模型的方式,而是直接采用已有的视觉语言模型(VLM)作为主模型,再使用更适合机器人任务的方法对其进 行微调(结合RT-1的视觉/语言/机器人动作数据集与互联网级别数据共同微调co-fine-tuning),最终输出机器人行为字符 串。 • 在这种训练方式下,机器人模型拥有一个已经预训练好的VLM模型,可以理解成一个互联网数据级别的常识系统,能够 识别物体、了解物体。而在后续的微调阶段,再加入机器人实际抓取物体的数据集, • 效果:在符号理解,推理和人类识别三项考核中,RT-2的正确率是对照组(RT-1/VC-1)的三倍。而在泛化性上,没见 过的物体,没见过的背景,没见过的环境等方面,RT-2相比对照组有一倍的提升。
RT-X:具身智能大数据集Open X加持的RT-2与RT-1
背景:希望能够开发一个通用X-robot,可以高效地适应到新的机器人、任务、环境。 • 原理:创造了新能的具身智能大数据集Open X:汇集了来自21个机构的22个不同机器人的数据,包含527个技 能和160266个任务。并用此数据集训练前述的机器人模型RT-1和RT-2得到新的模型RT-1-X与RT-2-X。效果:RT-1-X模型较原有RT-1或数据集原始模型的成功率有50%的提高,值得注意的是RT-1-X与RT-1的架构是相同的,因此性能的提高 完全是依靠数据训练的提升。RT-X最大的意义在于创造了一个仍然在持续增长的共享与开源的数据集(因为数据量在持续增长,RT-1-X与RT-2-X在训练的时候并没有 用到全部数据)。机器人数据不像大语言模型中的图片和文字那样容易获得,能够将多个机器人数据开源共享,覆盖足够多的场景与任务。 这一点与深度学习中的ImageNet相似。
3 目前机器人大模 型产业化发展的 问题与展望
全都是手臂和抓取——机器人大模型仍然处于非常早期阶段
可以看到目前大部分机器人大模型仍然以单机械臂抓取为主,从谷歌最新的Open X数据来看,单手臂的机器人形式仍然占据了 绝大多数。显然光机械臂无法满足大家对于人形机器人泛用性的需求。不光是谷歌,包括斯坦福李飞飞团队的VoxPoser等也都 是停留在物品抓取的阶段,距离常规理解的操作(从拧螺丝钉到组装宜家家具)还有较大差距。 对比手机产业发展进程,如果以IPHONE4出炉代表着智能机产业化的标志,那目前机器人行业仍然处在类似功能机的阶段—— 可以听歌、可以发短信,但是无法成为一个互联网的载体。
模型尚未定型、精细化操作不足——机器人大模型仍然处于非常早期阶段
从2022年4月谷歌推出SayCan模型以来,两年不到的时间,用于机器人的大模型已经经历过多次的模型迭代,但直至现在 仍然尚未有最终的模型定型。大模型仍然层出不穷,微软谷歌斯坦福等均有论文持续出炉,彼此之间甚至连任务定义还都不 一样。例如在将做任务规划的大脑与下层运动控制的方案之间的通信渠道的方案中,谷歌RT-2采取的是action tokenization, VoxPoser采取的是value map, SayCan采取的是value function, 这些技术路线还没开始收敛。我们认为目前机器人大模型 的技术路线还远未开始收敛。随着后续语言类大模型的持续发展,机器人相应的底层架构同样有变化的可能。
其次大模型目前展现出来的精细化控制能力较弱,很难做偏底层的运动控制。这主要是因为目前大模型直接输出离散的 tokenization的位置和状态,未考虑连续运动的轨迹平顺性、时间最优、功耗等额外因素。另一方面,对于精细化程度要求 较高的任务,可以通过Model-based方法处理,并且可以看到在工业机器人领域,很多控制精度要求较高的行业已经有满足 生产要求的工业机器人,因此大模型如果希望能够在工业中得到应用,精细化操作道路仍然较远。
产业启示:大模型需要到做到哪一步?
目前市场上公开的大模型大多以软件企业/学校为主导,无论是谷歌还是微软,都没有实际量产落地人形机器人,这种AI类 型公司的模型特点主要是期望能够打造一条端到端的,包含感知-决策-规划-控制全部流程的大模型。以谷歌为例,从 SayCan初次引入大模型用于做任务理解和拆分,到RT-1使用传统神经网络的方法来执行SayCan的任务,再到RT-2将VLM 大模型与RT-1的机器人执行数据集一起微调训练,谷歌的意图不仅仅是用大模型做基础的认知和理解,而是将底层的动作 也囊括其中。
而另一边,传统的机器人公司也在加入语言大模型方便理解任务,试图从底层控制入手,使用大模型进行一些常识、决策与 推理,类似SayCan,在这里大模型只扮演一个前期任务拆解的角色,而不会涉及后续运动方面的控制。 • 从目前进展来看,显然后者产业化进度相对而言更快,不少现有的机器人公司已经开始接入AI大模型系统,如智元科技的远 征A1,采用了语言任务模型 WorkGPT,结合了 LLM 和 VLM 等 AI 技术,能够为机器人提供自主感知环境、理解任务、编 排动作的能力。我们认为短期之内使用大模型来做通识理解、抽象思维、多级推理,配合model-base的小模型是能够较快 落地的商业方案。中长期看,随着人形机器人逐步落地,后续积累了足够多的机器人操作数据与3D环境数据,再使用大模 型+微调(类似RT-2)进行全部流程的训练,有望能够涌现出更好的表现。
产业启示:算力和数据缺口带来投资机会
以通识大模型+底层细分场景微调的框架为最终版本的机器人大模型来看,我们认为产业未来在算力、数据要素、 软件模型三个维度具有投资机会: 1、算力:机器人需要快速与环境交互,同时大模型本身要计算和存储空间。二者叠加之下机器人所需的参数和 算力比自动驾驶以及大语言模型都要更大,因此对于算力的需求将在后续逐步有所体现。看好算力相关产业链发 展。
2、数据:语言类模型的数据可以较为简单地从网上落得,而机器人的数据不同,机器人需要通过多种传感器感 知环境状态,然后执行实际动作来完成任务,一方面需要3D环境数据,另一方面需要的是主动数据,即需要机器 人主动实际执行才能得到的数据,此类数据量极度稀缺,以谷歌的RT-1的数据集为例,为了获得13万个执行轨迹, 需要使用人工遥操作演示示教的方式进行为期17个月的收集。后续虽然有可能可以通过模仿学习来进行学习,降 低数据成本,但是我们预计最终的底层操控的实现必然需要通过机器人实际操作才行。(类似学习自行车的过程, 虽然可以通过视频以及网络上的一些要领学习大概,但是真的掌握骑自行车必然需要实际操作过才能掌握)因此 看好具有先发优势,已经发布机器人产品,掌握机器人相关数据的公司。
3、细分场景的模型:未来大模型在机器人的应用,或许是通过底层的通识大模型+细分场景模型微调获得,其中 底层架构的通识大模型有望参考类似手机安卓的模式由头部的AI企业开源,而细分场景的模型(同时也包括所需 的数据)才是未来大部分企业可以竞争的市场。在这个赛道中,数据仍然是模型的基础,因此看好同时具有较强 机器人本体硬件与软件能力的公司。
编辑:520中国
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 10 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
