2025年智驾与机器人之VLA技术深度:行业概述、发展背景、架构案例及相关公司深度梳理
- 来源:慧博智能投研
- 发布时间:2025/11/05
- 浏览次数:486
- 举报
智驾与机器人之VLA技术深度:行业概述、发展背景、架构案例及相关公司深度梳理.pdf
智驾与机器人之VLA技术深度:行业概述、发展背景、架构案例及相关公司深度梳理。在当今科技飞速发展的时代,人工智能正以前所未有的速度重塑着各个行业的面貌。其中,VisionLanguage-Action(VLA)模型作为一项融合视觉、语言与动作三大模态的前沿技术,正在成为智能驾驶与通用机器人领域迈向更高智能化水平的关键推动力。从谷歌DeepMind将VLA框架引入机器人与自动驾驶领域,到众多企业纷纷投入研发并取得突破性进展,VLA技术的发展不仅为解决智能驾驶在复杂场景下的瓶颈问题提供了新思路,也为机器人从专用工具向通用智能伙伴转变带来了新机遇。本报告将深入剖析VLA技术的全貌。首先,对VLA模型...
一、行业概述
1、VLA 概念
当前,VLA 模型的快速发展正成为智能驾驶与通用机器人领域范式变革的核心推动力。VisionLanguage-Action(VLA)模型是将视觉(Vision)、语言(Language)与动作(Action)三大模态深 度耦合的端到端智能体系。其核心在于以统一的多模态表示与训练框架,将“看—懂—做”三环节打通: 模型直接接收图像/视频等感知输入与自然语言任务指令,经过联合表征与时空推理,输出可执行的物 理世界控制量(如机器人关节轨迹、车辆转向与纵向控制命令)。相较传统“感知—决策—控制”分段式 管线,VLA 以单一骨干网络承载跨模态特征对齐与意图理解,减少中间信息丢失与手工规则依赖,实现 对目标、场景、语义约束与行动策略的协同优化;在部署侧,可结合记忆与规划头实现闭环推理,提升对复杂、长尾场景的泛化稳健性与拟人化决策能力。VLA 因而成为智能驾驶与通用机器人迈向“大模型 一体化”的关键枢纽,并为后续与世界模型、端云协同训练及轻量化蒸馏等路径的结合奠定基础。 2023 年 7 月,谷歌 DeepMind 发布 RT-2 模型,将 VLA(Vision-Language-Action)框架引入机器人与 自动驾驶领域。通过融合大语言模型与多模态数据训练,该模型实现了任务理解与执行能力的显著跃升, 准确率提升近一倍,并具备对零样本任务的泛化能力,验证了视觉、语言与动作深度融合的有效性,为 VLA 在智能驾驶等产业化应用奠定基础。
2、VLA 三大核心模块
一般而言,VLA 模型架构具有三个核心组成:多模态编码器(动作、文本、图像等)、大语言模型用以 接收信息和进行推理、解码器用于输出轨迹和动作。但也有部分模型只含有两个模块,如 Open VLA 使 用 LLM 主干直接输出 action 指令。

3、VLA 应用现状
当前,VLA 在自动驾驶场景中得到广泛应用:VLA 模型从自动驾驶车辆各类传感器收集的数据里,挖 掘出丰富的周边环境信息;借助强大的语言模型理解人类给出的驾驶指令,并将决策逻辑梳理、展示出 来,生成可被理解的决策流程;最终转化成实际的驾驶操作指令,指挥车辆的行驶动作。 VLA 架构具备端到端和泛化等特点,使其在机器人领域具备应用潜力:VLA 能够直接实现从人类指令 到机械臂执行,即输入图像及文本指令,输出夹爪末端动作。VLA 架构具备端到端和泛化等特点:1) 端到端架构;2)泛化能力:该模型可以在新的物体、背景和环境中表现出显著改善的性能;可以理解 和响应未知的命令,并行进行推理和决策;3)通用性:VLA 建立在通用的大模型训练基础之上,理论 上所有的智能装备都可以使用同一套算法,只要经过适当微调就能满足特定应用场景的需求。当前机器 人 VLA 发展滞后于车端约 2-3 年,同时场景复杂度更高,构建数据闭环难度更大。 两者核心共性在于:1)均依赖多模态大模型底座,例如,理想 Mind VLA 与智元 ViLLA 均采用 MOE 架构实现任务分解;2)需构建数据闭环,车端通过 3D GS 重建,机器人则探索触觉传感器融合方案。
二、发展 VLA 的原因
1、VLA 是通往 L3 智能驾驶之钥
中国智能驾驶产业正向 L3 迈进,高阶智驾需求仍有巨大待满足空间。当前高速 NOA 功能已成为主流 车型标配,价格下探至 15 万元以下,同时技术进步带动价格下探与智驾市场扩容,城区 NOA 正进入 15-20 万元区间。城市 NOA 预埋装配率稳步提高,中国 L2 级智能驾驶渗透率已经达到 50%,具备向 L3 发展的技术和硬件基础。随着 2024 年首批 L3 试点车企和试点城市名单的公布,相关政策亦在逐步 突破,2025 年有望成为 L3 落地元年。在消费者层面,用户对智能驾驶大多持积极态度。20 万以上中 高端区间各价格段均有 55%以上的用户关注智能化,且 66%的用户已不满足于基础 L2 级辅助驾驶,智 能驾驶已成为购车的重要因素。但由于智驾技术尚未完全成熟,消费者对 L2 级别智驾在复杂场景下的 信任度较低,仍有需求尚待满足,L3 级为代表的高阶智驾具有巨大市场发展前景。而 VLA 是通往 L3 智能驾驶的关键技术路径,从而有效解决当前 L2 在复杂城市场景下的瓶颈。
2、智能驾驶技术不断演进,VLA 成为实现全局端到端的重要突破
智能驾驶技术正经历从“模块化端到端”向“全局端到端”的演变,视觉-语言-动作模型(VLA)将成为实 现全局端到端的关键突破技术。智能驾驶技术的核心架构由感知、决策规划、控制三个主要模块构成, 形成从环境感知到车辆控制的完整闭环。端到端(End-to-End)指通过单一神经网络模型,直接由传感 器原始数据输出车辆控制指令,无需传统分模块处理。当前端到端可分为两类:“模块化端到端”与“一段 式端到端”。模块化端到端为传统模块化结构与端到端的中间形态,分为感知层和决策层端到端。一段 式端到端则由一个神经网络模型完成全部操作,直接处理原始传感器信息输出控制信号。随着模块化端 到端技术的日臻完善、多模态大模型的技术赋能、芯片的算力突破,一体化智驾大模型呼声愈高,VLA 应运而生。视觉-语言-动作模型(VLA)以大语言模型为基础,能直接输出控制信号,大幅提高了复杂 环境适应能力和决策响应速度。
3、VLA 是驱动机器人迈向通用智能的关键
发展机器人 VLA 的核心驱动力源于对具身智能与机器人通用化的迫切需求,以及产业与市场的双重拉 动。传统机器人因局限于单一任务而缺乏泛化能力,VLA 通过大规模预训练和端到端架构,赋予机器人 适应复杂动态环境的能力,使其向“通用智能体”演进。VLA 支持“先思考再行动”,全面提升了机器 人行动的准确性,进而能适配多种硬件平台以应对工业、物流、家庭服务等多元化场景。与此同时,老 龄化社会催生的护理需求、工业领域人机协作的效率升级以及家庭服务市场的巨大潜力,共同构成了强 大的产业需求,而 FigureAI、Physical Intelligence 等公司的商业化落地成果,则标志着技术正加速从 实验室走向现实应用,加之 2025 年“人形机器人量产元年”所引发的资本与市场热情,进一步推动了 VLA 技术的研发与产业链布局,使其成为引领机器人从专用工具向通用智能伙伴转变的关键。
三、智能驾驶 VLA 模型
1、智能驾驶 VLA 发展历程
智能驾驶 VLA(视觉-语言-动作)模型的发展,正经历着从规则驱动到数据驱动,并最终迈向知识驱 动的深刻范式跃迁。在 2020 年之前,以百度 Apollo 为代表的传统模块化算法严重依赖人工定义规则,存在难以扩展的核心缺陷。2020 至 2025 年间,ChatGPT-3 的发布推动了端到端模型的兴起,特斯拉 等企业通过“两段式”架构整合感知与规控,但模块间的信息传递损耗问题依然突出。转折点出现在 2023 年后,Waymo 的 EMMA 模型首次将多模态大语言模型(LLM)引入自动驾驶领域,开创了 VLA 架构的先河;随后,2024 年小米 ORION 通过 QT-Former 有效解决了长时序记忆难题,理想 Mind VLA 则深度融合了 3D 空间理解与扩散模型轨迹生成技术,共同标志着知识驱动范式的成熟。步入 2025 年,产业落地进程显著加速:2025 年 1 月,元戎启行发布 VLA 模型并宣布与头部车企达成量产合 作,计划年内投向市场;同年 3 月,理想汽车宣布其下一代 VLA 模型将于 7 月首发于纯电动 SUV i8; 奇瑞也提出 2026 年实现 VLA+世界模型 L3 技术量产上车的目标,吉利等厂商亦纷纷投入研发,标志着 VLA 技术已成为智能驾驶竞争的核心高地。
2、VLA 与 E2E/VLM 的差异
VLA 的技术范式与 E2E(端到端模型)/VLM(视觉语言模型)的本质差异:相较传统“模块化/两段 式端到端”技术路线,VLA 的核心优势在于模态信息的深度耦合与端到端协同优化。传统方案下,各模 态(视觉、雷达、语言)独立运行,依赖固定接口实现信息传递,存在感知精度受限、信息在传输中损 耗严重以及多模块协调复杂等问题。尤其在涉及驾驶场景中长期决策、突发场景响应时,分段式管线会 造成认知延迟与执行不一致。而 VLA 通过统一多模态语义空间,将视觉信息、语言指令与行动策略在 同一模型内部进行联合建模与动态交互,从根本上降低了信息壁垒,实现对场景的整体理解与全链路响 应。其优势不仅体现在准确性和鲁棒性提升,更为后续的世界模型和长期决策规划提供了高质量的基础 输入。 VLA 对比 E2E+VLM:从“感知-决策”到“感知-认知-行动”。在“E2E+VLM(松耦合)”方案中,端到 端模型主要负责对感知层数据(如摄像头、雷达等)进行基础处理,VLM 则作为补充模块参与理解与 推理,但两者在系统架构上相对独立,信息交互受限,容易在复杂场景中出现响应滞后或语义对齐不稳 定等问题。而 VLA 代表了一种更前移的融合设计思路,其将视觉与语言直接引入“行动生成”环节,在同 一神经网络体系中实现语义解析、行为规划与执行决策的一体化联动。举例来说,当车辆接收到“变道 靠右”的语音指令时,视觉输入(如道路结构、周边车辆动态信息)与语言信号同步进入模型,在内部通过深度语义融合实现快速、精确的操作决策。这种架构显著提升了系统的响应速度和决策一致性,也 为未来实现类人驾驶行为打下技术基础。

3、智能驾驶 VLA 四个主要阶段
学术界将 VLA 模型在智驾方面的发展归纳为四个主要阶段:1)Pre-VLA:语言作为解释器 LLM 解码 器用自然语言解释驾驶场景或推荐操作,但实际车辆控制还是由传统模块(PID 控制器等)处理。无需 直接输出控制。2)模块化 VLA:语言模型从被动的场景描述者,变成了模块化架构中主动的规划组件, 类似:VLM+Action,Action 是拆开的。例如采用混合专家架构,如“超车专家”或“走走停停专家”,利 用语言提示根据上下文动态选择子规划器。3)统一端到端 VLA:单一网络直接映射多模态输入到控制 或轨迹输出,国内叫法可以称为一段式 VLA。但学术界也指出,端到端 VLA 的局限在于长程推理和复 杂多步规划能力有限。4)推理增强型 VLA:语言模型处于控制闭环的核心,同时支持长时记忆和链式 推理。这样它能在输出动作之前进行解释、预测并执行长远推理,真正实现代理司机的概念。
4、智能驾驶 VLA 的进阶能力
1)短期:人机交互的能力,从座舱体验延伸到驾驶实现智舱与智驾在功能层的协同创新。1)输入-语 言智能:用户可以直接与模型对话,模型可以自动拆解并执行任务。2)理解-视觉智能:具备强大的文 字理解及 OCR 识别能力。3)输出-行为智能:自主切换快慢思考(慢思考通过思维链 CoT 实现透明化 推理);给出文字解释其驾驶决策偶成,解决端到端系统“黑盒”问题。 2)中长期:AI 驱动的数据闭环是核心竞争力(数据仿真&强化学习)从单车智能向车路云协同(中心 化)。1)世界模型就是仿真高阶形式,用以弥补数据缺失的问题,强化学习能够帮助模型进行自我进 化。2)规模法则在辅助驾驶领域持续生效:模型性能随参数规模、训练数据量提升而提升。3)智驾算 法的优化依赖于车端芯片与云端基座模型的协同升级与匹配。
5、VLA 工程化存在的难点与痛点
极端工况下的模型稳定性:在暴雨、强光、隧道明暗突变等极端环境下,感知模块性能普遍出现显著衰 减,而语言指令也可能因识别误差而产生语义歧义。这类极端场景直接冲击 VLA 模型的跨模态稳定性 与鲁棒性。其技术难点在于如何实现模态间的动态互补机制,例如在视觉传感受限时通过雷达与语言引 导实现信息补强,或在语音识别不稳定时通过视觉和地图信息反向约束决策逻辑。同时,如何在复杂工 况下保证模态间的置信度判断与自适应权重调整,也成为端到端智能驾驶从“可用”走向“可靠”的关键门 槛。 长尾场景的泛化能力:自动驾驶的关键瓶颈之一在于对长尾低频场景的泛化,例如夜间施工、动物横穿 马路等,这些情境往往样本稀缺且分布复杂。传统以单模态为主的模型很难通过大规模监督学习有效覆 盖,而 VLA 模型虽然具备更强的语义表达与组合能力,但在少样本或零样本条件下仍面临跨模态语义 对齐不稳的问题。当前业界普遍通过预训练与迁移学习、语义分解等方式实现视觉—语言的动态耦合, 以提高语义映射的准确性与泛化性。然而,这一过程在实际工程落地中仍面临标注噪声、语义漂移和场 景偏移等系统性挑战,成为制约大规模落地的核心痛点之一。 多源数据的时序同步与时空一致性:VLA 模型的有效运行依赖多源信息(如摄像头、雷达、语音指令) 的时序同步与时空对齐。但在实际工程中,不同传感器的采集频率和延迟存在天然差异,如视觉帧率高、 语音输入低频,导致特征对齐时易出现时间错位和空间漂移,严重时可能干扰下游决策逻辑。为此,产 业界正在探索基于时空对齐优化的跨模态特征融合策略,如引入动态缓存机制、模态对齐层或中间对齐 表征,以缓解多源异步问题。但这一过程对系统架构设计、算力调度和算法鲁棒性均提出更高要求。
6、VLA 技术落地的关键抓手
(1)3D 中间表征:3D GS 或是车端实时获取良好 3D 中间表征的途径
实现感知—决策—控制的一体化桥梁。VLA 模型在车端和云端的高效运行依赖于稳健的 3D 中间表征, 这一特征本质上是连接感知层与决策层的抽象表示。自动驾驶中的中间表征不仅涵盖常规的场景语义、 道路结构、行人和障碍物等静态信息,还包含速度、运动方向等动态要素。通过对周边环境隐式与显式 信息的统一编码,3D 中间表征能够为下游决策提供高维、结构化的空间语义基础,有效减少感知结果 与控制指令之间的信息损耗。相比传统“2D 感知+规则决策”的模式,这种表征能更好地支持复杂驾驶场 景下的时空推理与闭环控制,使模型具备更强的泛化和鲁棒性,也为多任务协同(如路径规划、避障与 交通流预测)提供了统一的语义载体。 传统的端侧构建中间表达的方式有高精地图、BEV 鸟瞰图、占用网络、实时高精地图等方式,云端一般 为 NeRF 场景重建算法+素材库+游戏引擎重建环境,但传统的方法或多或少皆有缺陷,如端侧通过稀疏 查询(如实例框、地图元素)描述周围场景无法精细捕捉 3D 环境的细节导致决策过程信息不足、OCC 算法将场景表示为 3D 占用以获取更全面的细节,但稠密计算导致计算开销较大挤压了推理决策的资源, 云端也存在重建速度缓慢、重建真实性、丰富度不足等缺陷。而 3D GS 作为一种全面且稀疏的中间表 征获取方式,在场景精细度和构建效率方面取得了较好的权衡效果。
3D GS 是一种基于高斯分布的点云表示与渲染技术,有效权衡了场景重建真实性与重建效率的矛盾。 3D GS 的重建过程可理解为:1)将多视角图像或点云数据(如 LiDAR)经过运动结构恢复(Sfm)处 理生成稀疏点云;2)将点云转化为 3D 高斯点,并添加位置、颜色、形状分布、不透明度等信息形成场 景的初步表示;3)通过可微分渲染技术和自适应密度控制进行优化,最小化渲染图像和真实场景差异; 4)最后利用 GPU 生成最终图像并做到实时渲染。3D GS 的优异性能使其能够应用于自动驾驶仿真环境 重建、实时渲染建图、动态障碍物检测跟踪等任务。与传统场景重建技术 NeRF 相比,3D GS 具有计 算效率较高、自监督、渲染实时性等优势,为端侧应用提供可能。1)渲染实时性高,3D GS 能通过 GPU 并行化实现实时渲染(>30FPS),而 NeRF 渲染一帧需数秒至数分钟,相较之下 NeRF 更像一位 精细的画家,注重写实,而 3D GS 则是一位泼墨艺术家,注重写意,泼洒的速度会显著快于精细绘画; 2)数据需求较少,仅需少量多视角图像即可生成高保真模型,存储空间需求比 NeRF 减少 50%以上; 3)动态适应性,3D GS 可通过调整高斯分布的位置直接建模动态物体(如移动车辆),而 NeRF 需重 新训练或引入额外动态建模模块,效率较低;4)自监督学习,3D GS 可利用原图 RGB 信息进行自监督 学习,使重建模型利用海量数据进行自我训练成为可能。
(2)长时序记忆:强化长时序记忆能力将提升 VLA 模型长程任务规划与解决能力
应对动态驾驶场景的核心机制。在自动驾驶场景中,车辆决策往往并非基于单帧信息,而是对长时序信 息的持续理解与利用。由于大语言模型和感知模块天然存在时序窗口受限的问题,若模型缺乏长时序记 忆机制,容易在多步推理中产生信息遗失或语义漂移,导致驾驶行为混乱或目标识别失误。VLA 框架通 过引入记忆机制,强化了对时间维度的连续建模能力,使其能够在多回合交互、复杂交通流变化和突发 场景中维持稳定的决策输出。外部学术界和产业界也普遍将“时序建模”视为智能驾驶迈向类人驾驶能力 的关键要素之一,长时序记忆的增强不仅能提升准确率,更直接关系到整体安全性与可靠性。 LLM 模型实现长时序记忆的技术难点在于:1)Transformer 架构固有缺陷,标准 Self-Attention 的计 算复杂度为 O(N²),其中 N 为序列长度,导致实际模型能够同时处理的信息有限,造成历史信息丢 失;2)即使在同一文本窗口内,也会面临记忆稀释问题,即在长文本输入中,早期的信息可能被赋予 较低的注意力分数而被“遗忘”;3)长时记忆不仅要存储过去的信息,还需要动态地更新和清理“过时”或 “无关”的内容,对模型的架构设计和训练提出了更高的要求;4)单纯增加输入窗口长度需要更大的显 存和更高的计算成本,对于车端模型而言并不经济。 针对上述问题,业界提出了多样化的解决办法,诸如拓展文本窗口、缓存与检索机制、生成段落摘要、 动态记忆模块、稀疏注意力等。“稀疏注意力机制+动态记忆模块”组合或是较好的车端方案,使模型能 在“记忆能力”和“大脑容量”上获得提升:1)稀疏注意力机制通过选择性关注输入序列中的关键部分来 降低计算复杂度和内存消耗,尤其适用于处理长序列数据(如文本、图像、音频),其核心原理是通过 引入稀疏连接规则,限制每个查询(query)仅与部分键(key)交互,而非全局计算,从而将 Transformer 计算复杂度从 O(N²)降低到接近线性。例如谷歌 BigBird 模型通过引入稀疏注意力机制展 现了较好的性能,使模型能够处理的序列长度较传统模型提升至约 8 倍,同时显著减少了 GPU/TPU 的 内存占用,提高了模型计算效率,国内理想汽车 Mind VLA 架构中也引入了相似的处理方法。2)动态 记忆模块通过显示存储、动态更新与历史信息检索改善传统模型的记忆能力,记忆模块相当于给模型外挂一个存储 U 盘,同时通过学习的方式,模块还能自主识别重要信息以进行选择性存储,并根据输入动 态地调整存储的记忆数据,小米 QT-Former、理想早期双系统架构中的记忆模块都是该方法的代表。

(3)效率/能耗优化:优化模型架构与推理机制可以提高端侧计算效率
从单一算力堆叠到结构化算力优化成本维度的技术演进,是 VLA 能否规模化上车的决定性因素。当前 大模型在端侧的部署,受限于车规芯片的算力与功耗,直接影响推理时延与用户体验。因此,MoE (Mixture of Experts)专家混合技术与模型蒸馏、量化压缩方案逐渐成为主流路径。 模型量化可以降低模型内存空间占用并提升推理速度。模型量化核心思想是降低运算精度,即将模型中 的浮点数(通常是 FP32)表示的权重和激活值转换为低精度整数(如 INT8、INT4)或半精度浮点数 (FP16),从而实现模型压缩和加速的技术,其主要具有两大优势:1)降低模型内存空间占用,如将 FP32 模型量化为 INT8 模型,理论上模型的存储空间需求可以减少为原来的四分之一;2)加速推理, 低精度计算通常具有更高的计算吞吐量,目前许多硬件平台(如 CPU、GPU)对低精度整数运算有专门 优化,可以实现比高精度浮点运算更高的并行度和更低计算时延。量化后更小的模型规模和低精度计算 使模型端侧部署算力消耗更小。例如理想 LLM 模型 GPTQ 技术(后训练量化)大幅提升了模型计算效 率,使模型时延从 4.1 秒大幅降低至 1.9 秒,输出频率从 0.24Hz 上升至 0.52Hz。
MOE 架构在保持算力消耗相对稳定的同时实现模型扩容,进而提高模型性能。混合专家模型(MOE) 是一种“分而治之”的模型策略,核心思想在于将一个大的任务分拆交由对应专家(子模型)处理。例如 在 Transformer 架构中将前馈网络层(FNN)替换为一个 MOE 层,MOE 层通常由多个专家模型和一 个门控网络(一般是 router)构成,当模型需要解决任务时由学习后的门控网络将任务输送给对应专家, 从而实现在整体模型扩容的同时(更多的专家网络加入)其整体的计算消耗与传统稠密计算相当(同时 间仅有部分专家被激活,相当于一种稀疏化机制)。例如理想的 MindGPT 模型中引入了 8 位“专家”做 相关计算,每个专家单独训练可以负责其擅长的部分,如图像分割、处理输入的语音指令、动作规划等。
推理效率提升包括稀疏注意力机制、投机推理+并行解码等方法。由于 LLM 模型的并行计算能力,可 以近似理解其处理一个 token 和一批 token 的效率一致,在此前提下,投机推理机制通过引入一个或多个预训练的、参数较小的模型(draft model)预测生成多个候选 token,然后再利用标准模型对候选词 进行批量验证,从而避免了标准模型的重复调用以提升推理效率,该方式的难点在于如何提高小模型采 样准确性以避免标准模型验证次数较多;并行解码主要指在 transformer 中加入两种推理模型,如规划 决策实时性要求较高的 action token 采用双向注意力机制,通过单次计算即可输出所有信息;对于时效 要求较低的语言 token(如对自车行为的解释)则采用因果注意力机制逐字输出,投机推理+并行解码 的方法对模型输入和输出两端计算效率提升都起到一定作用。
(4)VLA 与世界模型深度耦合:利用世界模型构建云端仿真环境是模型闭环测试、强 化学习的关键
构建高保真仿真环境对 VLA 模型闭环测试验证很重要。自动驾驶模型测评分开环和闭环两类,开环是 单项流程,传感器输入→算法处理→输出结果,无反馈,常基于预录制数据测基础功能,适用于初步验 证;闭环是循环流程,传感器输入→算法处理→输出结果→执行动作和车辆反馈→作为新输入,涉及车 与环境交互验证、实时数据处理和决策,更能体现模型规划决策性能。开环测评与实际落地要求不匹配, 实车闭环验证成本高、安全性要求高,所以高保真仿真测试环境是 VLA 模型闭环的关键。 优秀的仿真环境能让车端 VLA 模型通过强化学习达到甚至超越人类驾驶水平。传统模仿学习的行为克 隆,是让模型通过监督学习复制专家行为,但存在上限低、泛化能力差的问题。强化学习则让智能体与 环境交互,通过尝试行动来最大化奖励,能优化车辆感知和规控能力。强化学习包括智能体、交互环境、 奖励函数、动作策略等,而优秀的仿真模拟器能提供“真实”的交互环境,对强化学习很重要。未来, 行为克隆(初步训练端到端模型)+逆强化学习(从专家数据中初始化奖励函数)+强化学习(通过与 环境交互改善模型和奖励函数)方案或将成为自动驾驶模型训练主流方案。
仿真环境构建方法多样,世界模型是未来有潜力的方向。目前学界对世界模型没有明确定义,但其应具 备以下特点:能理解物理世界并预测其演化;能进行反事实推理,具备泛化能力;能基于长时记忆自我演进。在自动驾驶领域,世界模型利用历史观测和预设条件预测未来场景变化和自车响应,核心任务包 括:生成未来物理世界(场景理解、运动预测、场景仿真);生成智能体决策与动作规划;将二者结合 并增加智能体数量,形成交互性交通场景。不过,当前世界模型生成方案还不成熟,所以基于部分真实 数据重建+世界模型生成的方案在自动驾驶仿真环境构建中更可行。 目前世界模型在业界的应用主要是场景生成,即作为数据生成器进行仿真环境构建,其可以看作 VLM 模型的逆向工程,构建方案本质上是 Prompt 控制+视频场景生成。 1)从视频生成的具体步骤,世界模型场景构建的步骤主要可分为:1)场景初始化,即收集真实的多模 态数据并对数据进行标注以形成真实数据的结构化表示;2)控制条件经编码器输入并生成带噪潜在空 间表示;3)扩散模型训练与结果输出;4)对生成场景进行优化和后处理。生成式世界模型方案中控制 条件的获取是其中的关键,因为生成式世界模型依赖控制条件(初始帧、相机轨迹、动静态结构化信息) 来保证生成场景的环境合理性、资产可控性、物理一致性以及提升渲染效率,这些条件本质上是将人类 先验知识注入生成过程,弥补纯数据驱动方法的不足。 2)从视频生成模型选择,主要有对抗式生成(GAN)、Transformer 回归生成、扩散模型等不同技术 路线,其中扩散模型相较于其余几种模型具备生成质量高且细节丰富、训练稳定性较强、生成结果多样、 生成过程可控等诸多优点,成为当前生成式方案的主流。 3)从视频生成方向角度,当前的视频生成方向主要有三个:①更多视角、更高分辨率,如华为 Magic Drive DiT 方案;②更长时间,如商汤 InfinityDrive 模型能够生成超过 2 分钟的片段;③高保真、时空 一致的 3D 渲染,例如理想《Drive Dreamer 4D》和《Recon Dreamer》,未来融合以上三种能力是世 界模型视频生成发展方向。 4)从视频生成优势角度,相较于通常的重建或生成方案,世界模型方案至少具备三项优势:1)摆脱对 于特定的、分布受限的数据来源的依赖,能够渲染复杂操作并保持图像的时空连贯性;2)基于世界模 型集成的物理引擎对物理规律的认知,生成的仿真环境除了解决 Vision Gap,还具备物理交互属性,为 方案增广至广义具身智能(如机器人领域)提供可能;3)生成方案实现的场景灵活多样,且生成成本 较低。
以理想汽车为例,理想汽车在自动驾驶领域针对世界模型的场景生成落地进展,主要体现在以下三个方 面: 1)初始场景不断完善,从 Dive、DriveDreamer4D 的图像信息,到 DrivingSphere、GeoDrive 的占用 网络和点云信息,从单纯 RGB 图像到 3D 点云结构渲染,从静态到动态,从主要目标到细节补充,对于 初始场景的刻画更加丰富饱满。初始场景(布局、光照、几何结构等)是后续生成渲然的基础,愈加完 善的初始场景可以避免生成完全随机,确保场景生成符合基本物理逻辑也为后续的场景交互编辑提供了 更好的基础; 2)生成控制条件不断升维,从二维道路结构等静态信息,到 3D 点云、占用网络等立体结构,再到车 辆可控运动等动态信息,最终升级为利用视频输入指导模型生成,以 3D 渲染和动态信息替代数值控制 信号。这既提升了生成场景的真实性,又便于闭环测验中的场景编辑。 3)更为重视闭环反馈机制的构建。《Driving Sphere》首次引入智能体协调模块,实现自动驾驶模型 与环境的闭环反馈;GeoDrive 模型进一步实现了场景实时编辑与 VLA 协同规划。 除以上模型构建的整体趋势外,理想的生成式世界模型还可按实际应用方向归类,总结如下:一是作为 数据机器用以生成简单的环境数据以弥补真实重建数据的不足,是较基础的数据生成模型。例如,Dive 模型通过道路结构和布局条目生成多视图视频数据;OLiDM 模型根据文本描述和 3D 边界框生成激光雷 达数据,并进行目标标注和空间语义对齐(例如解决 1 毫米像素空间对应 50m 现实距离的不合理问 题),解决了激光雷达数据规模小、标注难、场景多样性不足等问题。

二是在视频生成的基础上,进行大范围、多视角、高保真的场景渲染。理想在《DriveDreamer4D》和 《Recon Dreamer》两篇论文中提出了 NTGM+CDTS 和 Drive Restorer+PDUS 两个技术集,差异核心 在于 DriveDreamer4D 方案使用公开的世界模型,且在复杂渲染中表现还不尽人意;而 Recon Dreamer 方案中的 Drive Restorer 实际上是一个经过微调的世界模型,并利用 PDUS 方法使得模型在复杂渲染 (如多车道变换)中的性能更强。
DriveDreamer4D 模型利用世界模型解决 NeRF 和 3D GS 等重建方案的训练数据依赖问题。它通过轨迹 生成模块(NTGM)调整原始轨迹动作,生成新轨迹,获取新轨迹视角下的道路结构和 3D 边界框等信 息,最后将结构化信息、新轨迹初始帧、文本控制信息等输入到世界模型生成新轨迹视频。同时,它使 用 CDTS 在每个时间步上利用提取的结构化信息作为约束,将真实数据与生成数据进行对齐以减轻 4D GS 训练中的数据差异,具体表现为消除最终生成视频中的“鬼影”、“重影”现象。 Recon Dreamer 框架通过引入 Drive Restorer 模型和 PDUS 策略来解决大范围机动下的“鬼影”问 题,本质是经过自动驾驶数据微调后世界模型方案能力的进一步提升。Drive Restorer 是一个扩散生成 模型。理想汽车利用未充分训练的重建模型沿自车原始轨迹渲染低质量视频,与真实视频对比形成渲染 恢复数据集,并以真实视频数据为监督训练 Drive Restorer 去除鬼影,同时对天空、图像边界等重点区 域进行掩码操作以增强模型能力。PDUS 是一种渐进式数据更新策略,类似于自动驾驶模型的动态记忆 模块,在新轨迹生成过程中动态、分步更新初始渲染恢复数据集,由 Drive Restorer 处理得到新轨迹视 频,通过迭代直至模型收敛,最终提升模型在大范围机动复杂条件下的场景生成能力。
三是进一步提升对初始化场景的精细刻画与场景编辑能力。《DrivingSphere》通过 BEV 条件扩散模型 OccDreamer 生成城市级静态场景,并结合动态交通参与者的时空位置管理,构建精细化的 4D 世界表 示。GeoDrive 模型则以单帧 RGB 图像为输入,借助 MonST3R 网络精准估计点云和相机位姿,结合用 户轨迹信息构建三维一致性的条件序列,确保场景结构连贯真实。同时,引入点云信息使部分生成模型 能够在多帧点云聚合时调整物体边界框属性,提供修改后的 LiDAR 条件用于视频扩散模型,无需逐个 建模和优化,实现动态场景编辑功能,为模型高效训练闭环反馈奠定基础,如 GeoDrive 首次实现实时 场景编辑与 VLA 协同规划。
7、预计 VLA 技术将重塑智驾产业格局,并驱动车企向具身智能领域拓展 第二增长曲线
(1)预计 VLA 的渗透将带动汽车企业向科技企业转变,积累深、投入久的企业将具 备在高端市场竞争力
在“向下智驾平权”+“向上技术升级”的趋势下,车企自研与第三方合作的市场格局将发生变化,积累深、 投入久的企业将具备在 L3 等高阶智驾市场的竞争优势。2025 年产业掀起智驾平权浪潮使具备智驾功 能车型价格下探至 10 万元以下,智驾平权压缩了中低端车企成本空间,让具备性价比优势的第三方供 应商获得更多机会。而长期自研高阶智驾的头部车企布局智能驾驶时间较长,多已实现完整技术路径的 突破和技术积累,已形成技术领先的消费者心智,受智驾平权影响相对较小,未来将能够坚持自研路线。 VLA 技术发展预示着以大模型为基座的智驾方案加速应用,汽车企业逐渐向科技企业转型。L2-L4 的跃 迁是长期资金、算力、技术、数据的资源积累过程,因此产业链中积累深厚且投入持久的企业将具备 L3 等高阶智驾和市场竞争优势。未来,预计第一梯队的第三方智驾供应商所长期累积的技术与高性价 比优势将不断成为其核心竞争力,并全面覆盖高中低阶智驾市场。产业格局因 VLA 技术的发展而加速 变化。

(2)智驾 VLA 企业有望布局具身智能打造第二增长曲线
未来自研 VLA 车企和智驾 VLA 供应商凭借所积累的供应链硬件协同能力和技术迭代积累将在具身智 能领域释放巨大发展潜力。智能驾驶汽车作为具身智能分支,其技术架构与机器人等一脉相承,在硬件 传感器与零部件、软件算法技术方面均有共通性。一方面,两者结构相似,自研车企可将 VLA 技术低 成本复用至机器人领域,在算法上占据技术优势。另一方面,车企积累的供应链硬件协同能力,使其能 够快速涉足机器人产业,利用现有资源实现降本增效。目前,国内外众多车企已通过自研、投资、合作 等方式积极布局具身智能,将智能驾驶技术经验迁移到该领域,有望打造为第二增长曲线,但需进一步 解决机器人 VLA 面临的场景复杂度更高,构建数据闭环难度更大等问题。
四、机器人 VLA 模型
1、机器人 VLA 架构的发展历程
机器人智能化的尝试由来已久,VLA 方案或是未来通解。1966-1972 年,斯坦福研究院开发的 “Shakey”开启机器人“有思考能力”先河;2013 年,DeepMind 的 DQN 算法让机器人视觉与动作实 现同一神经网络控制,但泛化性差;2021 年,OpenAI 的 CLIP、Google 的 ALIGN 推动具身智能进入 VLM 时代,不过缺乏物理动作直接控制能力;2022 年,Google 的“SayCan”、CMU 的 “Instruct2Act”使模型能看图、理解指令并生成动作轨迹;2023 年,DeepMind 推出 RT-2 模型,奠 定 VLA 模型范式,让机器人走向“动得准”阶段。 近年来对于机器人 VLA 的探索主要集中于如何进行高效数据采集与模型架构优化两个方向(本文中机 器人更多代指人形机器人方案)。架构层面,从谷歌 RT 系列到 Open VLA 到 Helix、ViLLA 等,依托 VLM 进步,随着开源 VLM 架构优化与训练方法革新,相关成果拓展至 VLA,同时 Flow Matching、 Diffusion 等技术提升了机器人动作生成能力,模型整体架构呈现出多模态能力更强、动作生成更精细化、 泛化能力更优秀、一段式向双系统演变等发展趋势。数据层面,从谷歌私有数据集到多种开源真机数据, 再到仿真数据和互联网人类视频数据的引入,各机构通过多种方式丰富数据源,数据质量是 VLA 模型 发展的根本驱动力。
2、VLA 模型在机器人领域的主要方案类型梳理
VLA 模型存在多种技术路径和架构,衍生出来不同的方法,各具优势。
1)基于经典 Transformer 结构的方案,利用 Transformer 的序列建模能力,将强化学习轨迹建模为状 态-动作-奖励序列,提升复杂环境下的决策能力; 2)基于预训练 LLM/VLM 的方案,将 VLA 任务视为序列生成问题,借助预训练模型处理多模态信息并 生成动作,增强泛化性和指令理解能力; 3)基于扩散模型的方案,如 DiffusionPolicy、RDT-1B 通过去噪扩散概率模型生成动作,适用于高维动 作空间和复杂动作分布; 4)LLM+扩散模型方案,结合 LLM 的多模态表征压缩与扩散模型的动作生成能力,提高复杂任务中的 性能; 5)视频生成+逆运动学方案,先生成运动视频再通过逆运动学推导动作,提升可解释性和准确性; 6)显示端到端方案,直接将视觉语言信息映射到动作空间,减少信息损失; 7)隐式端到端方案,利用视频扩散模型预测未来状态并生成动作,注重知识迁移; 8)分层端到端方案,结合高层任务规划与低层控制,提升长时域任务的执行效率。
3、车端 VLA 与机器人 VLA 的核心差异
通过对机器人 VLA 与汽车 VLA 进行对比分析以探究机器人 VLA 数据闭环构建中面临的突出问题,本质 上汽车 VLA 与机器人 VLA 所面临的应用场景与任务的不同决定了二者拥有不同的商品属性和标准化 程度。汽车可以被视为一种低自由度的特殊机器人,所面临的场景和任务是结构化场景下的单一任务, 根本上决定了汽车是感知方式、输出控制、自由度、本体结构都相对标准化的耐用消费品,底层硬件结 构的统一性和场景、任务单一性决定了其数据采集方式、所采集的数据、模型设计的标准化;而广义的机器人由于所面临的场景与任务需求多样化,更多偏向于非标的可选消费电子类产品,更需要在模型设 计、本体结构标准化、数据采集效率、任务覆盖范围等多个条件中进行权衡。二者场景、任务的不同, 决定了二者商品属性和标准化程度不同进而决定了二者上层结构的差异。 从数据、仿真环境、端侧算力等具体角度对比汽车 VLA 与机器人 VLA 的差异性。整体来看,机器人 的数据闭环构建难度远超车端,其工程部署还需要解决标准化、本体交互能力、模型闭环等重要问题, 机器人 VLA 所面临的各种问题汇集在一起突出表现为当前还无法进行有效的数据收集进而构建完整数 据闭环,而无法 Scaling 的具身就无从谈起智能化,因此能够认为机器人 VLA 模型或智能化当前还处 于前期探索阶段,相较于汽车 VLA 专注于工程化,机器人 VLA 更是一个科研问题。
(1)机器人 VLA 训练所需的数据规模或远超车端
机器人 VLA 模型所需的数据更为复杂多样,核心原因在于机器人所面临的场景和任务更为多样化,泛 化能力要求远高于汽车。1)应用场景与任务不同,自动驾驶的汽车其所面临的结构化道路场景和执行 的驾驶任务都较为单一;机器人如人形机器人所面临的场景和任务非常丰富,部署场景从家庭、工厂等 封闭式场合到公共服务场合等开放式场景,任务从家政服务到工厂务工,几乎能囊括人类日常生活的各 方面,因此从训练数据的多样性角度,其数据需求远超汽车;2)模型能力要求不同,从应用场景和任 务出发,车端 VLA 重点在于提升端侧推理效率以增强模型的动态博弈能力,更加注重感知数据输入和 2D 轨迹规划输出以及模型实时决策,其数据维度较低(可以理解为一个动作专用模型利用同构低维数 据,强化学习反复迭代提升性能);机器人 VLA 则更为注重模型的泛化性,其所需求的数据除感知数 据以外,更为关注本体与真实世界的物理交互数据(如力反馈、摩擦力数据等),且更多输出 3D 空间 动作规划,所需数据的维度、复杂度更高。因此在假设完美完成一类任务所需数据规模差异不大的前提 下,机器人所需的数据从多样性到复杂度相较于车端都有较大提升。
(2)硬件方案未收敛与本体高自由度限制了真实数据收集
现有公开机器人数据集相较于车端数据非常匮乏。以特斯拉为例,其在多个场合提到 FSD 训练依赖于 上千万个视频片段,累计时长达到几万小时,相较而言,目前人形机器人领域较大的公开数据集如 X-Embodiment、AgiBot World 等,视频片段多在百万级规模。机器人硬件方案未收敛和本体高自由度导 致了真实数据采集困难。 1)硬件方案未收敛导致数据孤岛。目前广义的人形机器人硬件结构尚存在不确定性,例如本体存在轮 式方案与双足方案,手部结构如夹爪、灵巧手、三爪等机械结构尚未确定;传感器方案中视触觉、磁变 传感器的方案选择与具体排布位置也未有定论。且当前人形机器人数据采集方法多数集中在关节层数据, 如各自由度的角度、速度、力矩等,硬件不统一导致不同机器人关节结构差异较大,采集的数据具有极 强的平台依赖性,可复用性低,数据孤岛问题极大提高了数据采集成本,使得产业端难以通过规模化降 低数据成本。 2)高自由度导致数据采集效率低下。人形机器人与自动驾驶在自由度上差异最为显著,汽车仅有前后、 速度等两三个自由度,而人形机器人灵巧手+单臂自由度可达 20+,若双臂操作+全身控制,其自由度很 容易达到四五十个。高自由度带来诸多问题:1)本体高自由度的累计传递误差带来的本体精度问题以 及机器人本体-人体自由度不匹配导致映射算法构建困难,进而导致真实数据采集精度不够,有效数据 比例较低;2)较高的自由度对于当前主流的遥操、动捕等真实数据采集方式的人员及设备提出了很高 的要求,提高了数据采集的成本。
(3)算力解放是技术进步的前提
1)模型发展需要与底层算力匹配,算力解放是技术进步并应用的基础。车端以理想汽车 VLA 为例,经 过权衡端侧算力与计算效率,理想率先推出了双系统架构,其后 Orin-X 向 Thor 的迭代为双系统向 VLA 的迭代创造了算力基础,人形机器人目前较为流行的双系统架构也是行业权衡端侧算力与推理效率 之后的选择。2)机器人 VLA 模型算力需求更多但端侧部署环境更为严苛。一方面机器人面临的任务 和场景更多,云端模型训练面临的数据处理需求和所需的算力需求更多;另一方面,机器人端侧相较于 汽车,芯片运行工况更为恶劣,需同时处理的交互任务、自由度计算更多,散热、体积、功耗等要求更为严格。目前行业多采取高芯低频、部分计算核睿频的方式进行端侧计算,能够认为背后核心原因是行 业不成熟导致供应链不成熟所致,即缺乏一款专为机器人设计的芯片以适应机器人的工况和算力需求, 目前机器人芯片更多是其余行业芯片改制而来(如英伟达 Jetson 平台),未来尖端制程下放和专用芯 片研发成功或为机器人技术的快速迭代提供算力基础。
(4)构建可供机器人使用的仿真环境需要注重可交互性建设
机器人 VLA 对于仿真环境的要求比车端更高,需要更注重交互能力建设。构建优秀的仿真环境对于机 器人智能化非常重要,一方面,仿真模拟器可以提供仿真数据供模型进行基础预训练,一定程度弥补真 实数据不足;另一方面,优秀的仿真模拟器也能提供相对多样化、低成本、可拓展的强化学习环境。构 建优秀的机器人仿真环境需要解决三个问题:视觉差异、资产可微分、物理动力学,对于汽车环境的构 建,视觉差异是主要矛盾点(较少的涉及物理交互,一旦交互可大致判定为出现 corner case,策略失 败),而机器人因为天然的交互属性,需要更为注重交互能力建设。 目前在机器人仿真领域已有英伟达 Issac、清华 DISCOVERSE 等不同的仿真平台,但存在仿真数据简单、 底层物理规律与物体材质仿真困难等问题,如何解决物理规律问题是仿真领域即将面临的核心矛盾,我 们认为从模型和数据角度,未来世界模型+多模态数据或是实现可交互仿真环境建设进而实现机器人物 理可交互性的两条路径。世界模型仿真路线尚未有确切的实现路径和定义,4D GS(3D GS+时间轨迹) +生成式方法或是潜在方案,例如理想 Recon Dreamer、GeoDrive 模型、清华与北大合作的 PartRM 模 型,以 PartRM 模型为例,其将物体施加力到完全移动形变的过程视作一个 4D 数据,并广泛收集 4D 数据集去训练 3D GS 的形变过程以获得可微分的资产,其将动力过程视为隐式内容学习使构建的环境具 备物理属性,虽然隐式学习的方法从实现效果上可能略逊于显示约束的动力学模型,但是利用视频数据 作为输入和自监督的方式从 learning base 角度,这类方法或更具备 scaling 潜力。

从数据角度,引入触觉信息实现多模态感知进而构建运动反馈也是构建交互能力的重要方法,当前主流 传感器中,图像和深度传感器(激光雷达等)实际都是视传感一环,而触觉传感器是真实的交互式传感 器,在 real2sim 过程中,当数据稀缺或视觉信息不足时,融合触觉信息能很好的提升 3D 重建效果。目 前触觉传感器的技术路线尚未收敛,能够认为从成本、传感器精度、部署灵活性、检测范围等角度考虑, 霍尔磁电式、视触觉传感器或是较好方案。
4、机器人 VLA 落地可能面临的问题
综上所述,能够认为机器人 VLA 部署仍是一个中长期事件,如何破局数据-模型-本体构型的鸡生蛋问 题、如何寻求合适的落地场景,使机器人或严格定义为人形机器人从一个遥控玩具和科研展品走向真正 的商业、工业落地,成为一个具备独立思考能力能够准确理解世界、具备泛化性、能够使用运动技能与 现实世界交互的物理 AI,从前置条件或发展方向看,能够认为在标准化与模型优化两个方向值得重视: 首先需要标准化,尤其是底层硬件、通信协议的标准化,然后在此基础上实现本体部分标准化,例如在 C 端场景定义通用的人形机器人构型,在 B 端场景定义少数几种适合大部分场景、任务的类人性或其余 形态机器人构型。1)从数据收集、模型与本体适配角度,如同大多数人惯于使用右手且很难在短时间 内变成左撇子,机器人的数据、模型都需要与确定的本体构型相匹配才能最大化模型效果,“一脑多型” 方案在当前阶段对于模型能力、训练算力、映射算法的要求过于理想化,能够认为先确定基本构型然后 在此基础上进行数据收集和模型构建,实现规模化数据收集与复用以解决数据孤岛问题和破局数据-模 型能力的鸡生蛋问题是较为可行的方案;2)从行业供应链角度,没有行业基本零部件或构型的标准化 就构建不了顺畅的供应链,当前从其余行业进行零部件改制供应的现象就会一直存在,导致行业整体上 下游的匹配摩擦成本、制造成本无法下降,产品的最大化效能也无法发挥。
实现标准化最需要的是时间,即需要等待机器人行业走过野蛮生长的时段,待产品和应用场景进一步清 晰以后等待行业的“iphone4 时刻”,一款革命性的产品自然会引来行业跟随与供应链统一。在此之前较 为可行的现实路径是在业内建立部分标准化共识(底层逻辑为机器人可能是大部分标品+部分非标品的 现实),例如实现通信协议、自由度、感知方式的逐步标准化进而尝试构建初步的数据闭环系统。 其次是上层系统的优化,主要是机器人模型闭环与交互能力构建。1)从模型设计角度,目前业内的大 小脑系统多是割裂的单独训练和线性无环结构(如缺乏反向传播),从模型架构出发,机器人 VLA 模 型的落地需要借鉴语言模型和汽车端到端经验,首先需要实现真正的端到端可训,即设计一种类似人类 的高低频自适应系统,在算力足够的基础上实现大小脑不同频率下的联合训练;其次是实现模型闭环训 练,即将输出 action 反馈回模型输入并进行 test time compute,利用强化学习方案彻底提升模型行为 能力的泛化性、准确性和鲁棒性等。2)从交互能力角度,如前所述,机器人相较于汽车更为强调物理 交互能力,能够认为物理仿真能力(世界模型)和多模态数据(触觉、嗅觉等)引入或是未来机器人向 真正拥有物理世界理解和交互能力的具身智能体转化的关键。
5、预计机器人 VLA 的发展将经历三阶段突破
1)短期(2025-2027),硬件标准化先行,通过通信协议统一(如 Open VLA 开源架构)降低数据采集 成本,解决"鸡生蛋"问题; 2)中期(2028-2030),世界模型+多模态传感器成为主流,借鉴车端 GeoDrive 经验,构建 4D GS+ 生成式仿真的混合环境,重点突破力反馈数据的 real2sim 迁移; 3)长期(2030+),形成"基础模型+垂直专家"的产业分层,类似理想 Mind VLA 的 MOE 架构将拓展 至机器人领域,实现从专用控制到通用智能的跨越。风险点在于:过度追求通用性可能延缓商业化进程, 应关注聚焦特定场景(如家庭服务、精密制造)的差异化路径,这类场景任务边界清晰,更易实现数据 -模型-本体的正向循环。
五、VLA 架构案例
1、自动驾驶典型 VLA 架构
(1)Waymo EMMA:开创性的端到端多模态自动驾驶模型
作为早期开创性模型,EMMA 模型架构较为简单,主要由编码器+大语言模型构成。感知部分, EMMA 模型开创性的同时处理文本(导航指令、自车历史状态)、图像(摄像头视频感知)等多模态 输入,并利用视觉-语言框架将所有的输入和输出表示为普通文本,将驾驶任务转化为视觉问答(VQA) 问题,充分利用其 Gemini 大语言模型储备的大量知识,更好的理解驾驶任务中的动态变化;推理输出 方面,为了增强模型的推理能力使之更符合自驾需求,EMMA 对原有大语言模型进行了微调,通过混 合训练来实现更多自驾能力,具体而言,其将感知任务拆分为空间推理、道路图估计、场景理解等多个 子任务,使微调的 LLM 模型能够更好的生成各种运动规划和驾驶控制信号。 EMMA 框架具有三大特性。1)EMMA 将所有的输入和输出表示为自然语言文本形式,所有任务共享 统一文本表示空间,可以最大限度的调用语言模型的知识储备并提供了将其余驾驶任务继续融入系统的 拓展性;2)引入 CoT 增强模型的可解释性,EMMA 将 CoT 融入到轨迹生成中,要求模型在预测时阐 明相关理由,例如将推理过程结构化为场景描述、关键物体描述、关键物体行为描述、驾驶决策输出四 个子任务,数据集测试结果显示,引入 CoT 的模型相较于基准模型整体性能提升了 6.7%,在驾驶决策 和关键物体识别的能力上分别提升 3.0%和 1.5%;3)自监督模型,模型训练唯一需要监督数据的是自车 未来位置,其余数据不需要专门人工标签,提高了数据来源的可拓展性。
EMMA 在公开数据集的开环测试取得了较好效果。EMMA 采用最小尺寸基座模型 Gemini 1.0 Nano-1 分别在 WOMD 和 nuscens 数据集上进行了端到端轨迹预测的测试。在 WOMD 数据集中,经过内部预 训练的 EMMA+模型在短时间窗口上的 ADE(平均位移误差)性能超越了基准模型,但在较长时间窗 口表现较差,主要是 EMMA 只有摄像头输入,基准模型结合了激光雷达,深度感知能力更好;在 nuscens 数据集中,自监督的 EMMA+取得了 SOTA 效果,比参与测评的监督基准模型平均性能提高 6.4%,比自监督的基准模型性能提高 17.1%。 作为自动驾驶 VLA 的初步尝试,EMMA 距离工程部署尚有距离:1)模型仅能处理有限帧数,难以捕 获驾驶任务所需的长时间依赖关系,自动驾驶性能较差;2)依赖预训练的多模态模型,但该模型未集 成与点云相关的编码器,3D 空间感知和多模态能力受到限制;3)当前测评基于公共数据集上的开环测 试,模型闭环性能不清晰,距离工程部署尚有距离;4)参数规模庞大的语言模型在车端部署对端侧芯 片算力、带宽带来挑战,车端推理实时性不足,需要在模型大小、推理质量、推理效率之间实现平衡。
(2)Open Drive VLA 框架的贡献在于模型 3D 环境感知和交互
Open Drive VLA 是专为自动驾驶设计的端到端 VLA 模型,主要包含一个预训练的视觉编码器和一个开 源 VLM 模型。模型首先利用预训练的编码器从多视图图像中提取中间特征;然后分层视觉语言特征对 齐模块将图像 token 对齐到文本域;其次在 VLM 推理空间中进行车辆-环境-自车交互推理和输出高层 次的驾驶指令,最后根据高层次指令给出自车的未来轨迹。架构的创新在于 1)引入以视觉为中心的查 询模块和分层视觉-语言特征对齐模块,提升模型 3D 感知能力;2)引入条件车辆运动预测任务,提升 自车复杂环境下交互能力。
3D 环境感知与对齐:传统的 VLM 模型通常依赖于 2D 视觉编码器,视觉 token 的选择和注意力权重通 过语言监督间接引导,模型缺乏足够的 3D 空间感知能力会造成严重的多模态输出幻觉(即语言模型的 反应与图像输入内容不一致)。针对此问题,Open Drive VLA 在感知环节采用了以视觉为中心的查询 模块,使模型重点关注与驾驶相关的物体和 3D 地图信息,具体而言在模型获得 BEV 特征表示后,会用 三个视觉查询模块(Track、Map、Scence)以空间定位的方式捕捉动态车辆行为和静态地图结构,以 获得 3D 中间特征表示。并利用分层视觉-语言对齐机制弥补不同空间的模态差距,即指针对三个特定的 查询模块引入三个特定的可训练投影机制进行视觉嵌入,使得不同模块的视觉信息都有详细的语言描述与之对应,达到对齐视觉和语言模态的效果,例如对于 Map 信息,以真实标注数据训练的文本转化机 制可以将车道分隔线、人行横道和道路边界等地图元素都转化为描述性文本。 轨迹生成与环境交互:Open Drive VLA 引入了条件车辆运动预测任务,作为 3D 车辆-环境-自车交互建 模的代理任务,使模型能够学习不同物体在空间中的运动模式,即模型能够在给定场景描述、地图结构 以及自车状态后,在推理空间中直接预测每个实体相对于自车的未来位移,并给出自车在此条件下的未 来运动轨迹预测。该任务的引入增强了模型轨迹生成能力,并改善了复杂交通场景中的决策能力。从开 环评测效果角度,如下图所示,相较于 UniAD 模型,Open Drive VLA 对环境的感知能力更强,没有对 周遭车辆的过度反应,生成的轨迹更为平滑。
Open Drive VLA 仍面临诸多问题。1)为了平衡模型推理速度和计算开销,LLM 模型采用隐式推理,缺 乏明确的 CoT 过程,导致模型在复杂场景中的推理能力和模型的可解释性较差;2)目前的测评仍是开 环评测,后续的闭环测试和仿真场景搭建预计仍然存在困难;3)模型的自回归特性阻碍了高速场景中 的实时推理。
(3)小米 ORION 框架引入 QT-Former 模块实现了长时序记忆
小米 ORION 架构是典型三段式 VLA 架构,主要由三个关键组件构成:QT-Former、LLM 及生成式规 划器。首先通过视觉编码器对图像编码;其次 QT-Former 实现长期上下文提取并连接视觉空间与 LLM 模型的推理空间;LLM 将场景特征、历史视觉信息、用户指令等多模态信息结合执行推理任务并预测一 个规划标记;最后生成式规划器生成由规划标记条件约束的多模态轨迹。该框架利用 QT-Former 和生 成式规划器分别连接了视觉-推理、推理-动作空间,实现了从图像感知到视觉问答再到动作规划的统一 端到端优化,模型创新之处在于 QT-Former 动态记忆模块的引进一定程度解决了长时序记忆问题以 及 VAE 模块优化了轨迹生成。
QT-Former 模块实现图像压缩和长时序建模。通常 VLM 模型要求输入的都是高分辨率图像,但高分 辨率图像 token 化后计算量较高,不能保证端侧模型输出的实时性,因此小米引入了 QT-Former,其类 似一个信息筛选机制,负责提取对语言文本生成最有用的图像特征并压缩转化为 LLM 可以理解的 token。 长时序建模层面,传统 VLM 模型一般利用拼接多帧图像进行时序记忆,这种方法受制于 Token 长度, QT-Former 引入了动态记忆模块和历史查询机制一定程度上解决了长时序记忆的问题。其运作机理为初 始化感知 Query 与场景 Query,首先原始感知 Query 与场景 Query 先通过自注意力模块交换信息;然 后与带有 3D 位置编码的图像特征执行交叉注意力并分别获得感知结果及新的场景 Query,其中感知结 果被输入至任务头用于各项任务,新的场景 Query 与 long-term Memory Bank(记忆库)中的历史 Query 再执行交叉注意力以不断地更新历史 Query 并按照先进先出的替换原则再存储到记忆库中。其创 新之处在于,不同于以往记忆模块只简单存储压缩后信息而不关注提取当前场景信息的机械机制,小米 通过初始化少量历史 Query,能够进一步提取与历史信息最密切相关的当前场景特征,增强了模型的 长期记忆能力。

小米 ORION 架构的工程化部署面临挑战。根据小米公开数据,ORION 架构在 Bench2Drive 数据集上 获得了较好的闭环测试性能,获得了 77.74 的驾驶分数和 54.62%的成功率,相较于 SOTA 方法分别增 长 14.28 分和 19.61pct 的成功率。但能够认为其距离商用落地仍有较多工作:1)基座模型使用开源模 型 Vicuna v1.5,没有针对自动驾驶做微调,不同模块间的配合及针对自驾任务的性能可能不足;2) LLM 模型参数规模庞大,端侧推理实时性难以保证。目前可行的路径之一是将 QT-Former 与 VAE 模型 连接,将 LLM 模型用作辅助推理,形成实质的双系统模式,在端侧芯片能力足够和模型运算效率优化 以后再部署全局端到端;3)图像编码器或仍沿用传统的 2D 网络,模型的 3D 空间理解能力较弱影响模 型性能。
(4)理想 Mind VLA:深度融合空间、语言及行为智能
Mind VLA 六大关键技术,构建自驾模型新范式。24 年 10 月理想汽车双系统架构正式推送,但彼时 的模型架构尚存在诸多问题,例如双系统联合优化困难、基于开源的 VLM 模型在 3D 空间理解能力上 仍然不足、模型的多模态性处理不足(输出方式为 Transformer 回归建模,难以处理驾驶行为多模态 性)、人类价值观对齐不足等。基于双系统实践和对前沿技术的吸收,理想汽车推出了自研 Mind VLA 模型,提出了 6 大关键技术:3D 空间理解能力构建、基础语言模型构建、语言模型推理效率优化、 Diffuison 轨迹生成、RLHF、云端 worldmodel 强化学习。其模型方案可以理解为:利用 3D 空间编码器编码环境特征输入至语言空间,语言空间利用逻辑推理能力和空间理解能力将输入信息处理后给出合 理的高层级 action token,然后通过 diffusion 模型进一步优化出最佳的驾驶轨迹,实现空间智能、 语言智能、行为智能的统一。
基础语言模型重构、RLHF、云端 world model 强化学习主要解决模型计算效率与类人性问题。除了 从算法优化的角度提升模型计算效率,从模型自身构建角度是更为根本的解决方法,当前 VLM 一般是 由开源 LLM+预训练 Vision encoder 构建,这类方法简便易行,但基于互联网数据训练却限制了模型 VL 部分的实现效果,一方面是开源 LLM 虽经过微调与后训练,但模型构成中仍有大量与自驾无关的参 数占用硬件资源;另一方面是基于开源数据训练的 Vision encoder 无法充分利用自驾领域成熟的感知网 络。理想重新配比了 3D 数据、自动驾驶相关图文数据与文史类数据的比例,从零训练语言模型并自定 义自驾专用 LLM input tokenizer,根本上选择了更为困难但上限更高的路径以解决模型效率问题。 RLHF 与云端世界模型强化训练是模型后训练环节,主要解决模型类人性问题。RLHF 方法是通过筛 选大量 NOA 接管数据(不符合人类预期的表现)以建立人类偏好数据集,使模型从特定的偏好数据中 学习对齐人类行为,提升模型的安全下限。同时 Mind VLA 基于自研的重建+生成云端统一世界模型, 深度融合重建模型的三维场景还原能力与生成模型的新视角补全,以及未见视角预测能力,构建接近真 实世界的仿真环境实现了基于仿真环境的大规模闭环强化学习,并利用工程化能力将 3D GS 的训练速度 提升了 7 倍以上。通过创新性的预训练与后训练方式,Mind VLA 实现了优秀的模型表现与泛化能力, 预计将成为部署与量产最快的车端 VLA 模型。
2、人形机器人典型 VLA 架构
(1)Open VLA:首个开源且具备商业潜力的机器人 VLA 模型
机器人 VLA 模型发展的早期阶段,模型的封闭性、庞大的参数规模限制了其大范围推广。由于机器人 数据集规模远不及互联网数据集,直接复制大语言模型级别的预训练在机器人领域是几乎不可能完成的 挑战,因此利用现有 VLM 方案作为基础模型并加入动作模块,再利用机器人领域真实数据做微调形成 可直接生成机器人控制动作的 VLA 模型成为主要的解决思路。但在 Open VLA 之前两个问题阻碍了 VLA 方案的广泛应用:1)模型封闭:模型大多闭源,缺乏关于模型架构、训练过程和数据集的透明度, 模型很难复现;2)缺乏部署能力,即以前的 VLA 模型未能提出如何在新的机器人本体、环境、任务中 部署 VLA,特别是没有对 VLA 范式在消费级 GPU 上的端侧部署能力进行探讨,对于 VLA 范式的研究 多停留在实验室阶段,例如 Google RT-2 模型,其闭源属性和庞大参数规模限制了模型的大范围应用。 Open VLA 为一个 7B 规模的 VLA 模型,能够在接收信息后预测 7 维的机器人控制动作,其模型架构 主要由输入模块、LLM 主干两部分构成。 输入模块由两个视觉编码器、小型两层 MLP 投影器(用于映射)、Llama 语言编码器构成,其中视觉 编码器部分包含预训练的 SigLIP 和 DinoV2 模型,输入图像 patch 分别通过两个编码器得到结果特征向 量,相较于 CLIP 或仅 SigLIP 编码器,添加 DinoV2 编码器有助于提升模型空间推理能力,更能理解物 体间的准确位置关系。 LLM 主干部分为一个 7B 规模的 Llama2 大语言模型并在 Open X-Embodiment 机器人数据集上进行了 微调,接收图像、文本等多模态信息并进行推理输出 action token。模型利用栅格法,将机器人连续的 动作离散化分散到 256 个栅格中,每一个栅格可以被视作一个 token。当机器人动作被处理为 token 序 列后,VLA 模型即能够以标准的自回归方式预测下一个 token 为目标进行训练。
Open VLA 论证了机器人 VLA 范式的商业部署潜力。1)Open VLA 相较于前代模型如 RT-2,在整体 规模缩小的情况下实现了更优越的性能,Open VLA 在通才操作方面表现出色,在 WidowX、Google Robot 两个平台 29 项任务和多种机器人实例测试中,其绝对任务成功率对比闭源模型提高 16.5%,同 时模型参数规模减少为原模型的 1/7;2)利用 LoRA 和模型量化提高计算效率并压缩了模型规模, LoRA 即低秩自适应方法,是一种利用矩阵降秩计算原理实现模型微调的方法,能在模型参数不变的情 况下提高模型训练速度和降低显存占用,同时结合模型量化为模型在消费级 GPU 上部署提供可能;3) 完全开源,Open VLA 完全开源代码库,支持从单个 GPU 微调到多节点 GPU 集群、十亿级参数规模的 VLA 训练,并支持自动混合精度、分片数据并行等大型 transformer 架构训练技术。整体看来,Open VLA 旨在为机器人操作提供通用策略,其较好的模型性能、更小的参数规模和完全开源特性论证了 VLA 范式的商业部署、技术生态建立的潜力。
(2)Helix:首个人形机器人上半身高速连续控制的开源模型
Helix 是人形机器人领域首个“双系统”分层模型,用于高速灵巧地控制整个机器人上半身。如同车端 “VLM+E2E”双系统架构前所面临的问题,Helix 之前的 VLA 模型也面临根本性权衡:VLM 有强大的泛 化能力,但无法满足实时性要求;传统机器人运动控制策略速度快,但泛化能力不足。因此 Helix 通过 设计两个互补系统来解决矛盾: 系统 2(S2):一个机载互联网预训练的 VLM,以 7-9Hz 运行,用于场景理解和语言理解,实现跨目 标和上下文的泛化。S2 建立在 7B 参数开源、开放权重 VLM 上,该 VLM 在互联网规模数据上进行预训 练。S2 将机器人视觉图像和状态信息(包括手腕姿势、手指位置)投影到视觉语言嵌入空间后进行处理。 结合指定所需行为的自然语言命令,S2 将所有语义任务相关信息提炼为单个连续潜向量,并传递给 S1; 系统 1(S1):一种快速反应的视觉运动策略,可将 S2 产生的潜语义表征转换为 200Hz 的精确连续机 器人动作。S1 是一个 80M 参数交叉注意编码器-解码器 Transformer,用于处理低级控制。来自 S2 的 潜向量被投射到 S1 的 token 空间中,并沿序列维度与来自 S1 视觉主干的视觉特征连接起来,提供任务 调节。S1 以 200hz 输出完整的上半身人形控制,包括所需的手腕姿势、手指屈曲和外展控制以及躯干 和头部方向目标。在动作空间中附加一个合成的“任务完成百分比”动作,使 Helix 能够预测自己的终止 条件,从而更容易对多个学习的行为进行排序。
Helix 不同于传统的双系统模式传递语言指令等显式命令,而是依靠隐向量进行信息传递实现了模型的 端到端可训。Helix 使用了单一神经网络在一个约 500 小时、高质量的多机器人数据集上进行监督训 练,使模型获得了多项特性: 1)训练速度与泛化能力:模型在双系统架构下使用单一神经网络训练,双系统架构的优化使模型训练 速度能够与针对单一任务进行优化的行为克隆策略相匹敌;单一神经网络使模型无需对每个新物体、任 务单独训练微调,展现出其出色的通用性。 2)可拓展性:Helix 能够直接输出高维动作空间的连续控制,而不需要像过去的 VLA 方法使用复杂的 离散动作标记方案。例如 Open VLA 的离散化方法在低维度的控制任务中很管用(通过将简单的机器人 动作与特定 token 对应),但在某些需要更复杂任务步骤、更长的任务时间、更精细化连续化的机器人 控制的高维任务中,传统的离散低维方法难以奏效。 3)模型解耦:将 S1 与 S2 解耦,Helix 可以分别优化每个系统,不受寻找统一观测空间或动作表示的约 束。 4)商业落地能力:Helix 是首个完全在嵌入式低功耗 GPU 上运行的人形机器人 VLA 模型,可以立即投 入商业部署。

Helix 实现了人形机器人历史上多个“首次”出现的强大功能: 完整的、细颗粒度的上半身控制能力。Helix 是首个能够对整个人形机器人上半身以 200Hz 的频率协调 35 自由度动作空间并进行高频率连续控制的 VLA 模型,较好的解决了人形机器人上半身完整控制的两 个难点:1)超高自由度,一般而言传统机器人最多控制个位数自由度,35 自由度意味着机器人每秒要 实现 35 个部位的动作方向、角度和力度等维度的控制并进行整合优化,每个自由度的增长会使模型计 算量呈指数级增长,Helix 高频连续动作控制展示了模型极强的计算能力;2)实时协调能力,机器人的 头部或躯干移动时会改变机器人的可触及和可视范围从而形成一个新的反馈回路,这需要机器人实时的 做出新的判断和动作,使系统的不稳定性增加,Helix 通过先确定躯干最优位置,再以头部视角追踪手 部移动的方式实现了在高维动作空间中的协调性。 零样本多机器人协调。Figure 展示的视频中显示两个机器人通过自然语言指令(如将盒子递给你左边的 机器人)进行协调,能实现对训练中从未见过的全新物品的协同操作,这项能力主要通过两种方式实现: 1)充分利用系统 2(VLM 模型)的互联网先验知识实现了自然语言指令输入与全新物品识别;2)利用 单一神经网络+多机器人、多任务场景数据集微调实现多机器人在同一模型控制下的协同操作,其中单 一神经网络使模型可以学习所有机器人行为和跨机器人互动,“多机器人、多任务、多场景数据集微调” 的能够更真实地模拟复杂环境、任务和团队协作能力,为多机器人间的交互协作奠定数据基础。
涌现“拿起一切”的能力。Figure 视频中显示,只需一个“拿起”指令,搭载 Helix 的机器人即可在没有任 何先前演示或自定义编程的情况下拾取几乎所有的小型物品,同时 Helix 还可以建立互联网规模的语言 理解和精确的机器人控制之间的联系,例如当被提示“拿起沙漠物品”时,Helix 不仅能确定玩具仙人掌 与这个抽象概念相匹配,还能选择最近的手并能通过精确运动控制进行抓取。这种通用的“从语言到行 动”的能力为人形机器人在家庭、工厂、餐厅等非结构化环境中的部署提供了可能性,凸显了 Helix 的商 业部署能力。
(3)智元 ViLLA:实现大规模互联网异构视频数据高效利用
2025 年 3 月 10 日,智元发布通用具身基座大模型——智元启元大模型(Genie Operator-1)。该模型 采用 Vision-Language-Latent-Action(ViLLA)架构,该架构由 VLM(多模态大模型)+MoE(混合专家)组 成。其中 VLM 借助海量互联网图文数据获得通用场景感知和语言理解能力,MoE 中的 Latent Planner(隐式规划器)借助大量跨本体和人类操作视频数据获得通用的动作理解能力,MoE 中的 Action Expert(动作专家)借助百万真机数据获得精细的动作执行能力。

VLM(多模态大模型):采用 InternVL-2B,接收多视角图像、力信号、语言输入等,进行通用场景感 知和指令理解。 Latent Planner(隐式规划器):LP 是 MoE 中的一组专家,其基于 VLM 的输出结果预测隐式动作标记 以进行高层级动作规划。为了大规模利用互联网视频数据和训练 Latent Planner,ViLLA 架构在云 端引入了 LAM 模型来建模互联网人类动作视频当前帧和历史帧之间的隐式变化,然后使 Latent Planner 预测这些变化以进行学习,从而将异构数据源中真实世界的动作知识迁移到模型能力中。
Action Expert(动作专家):AE 是 MoE 中的另一组专家,通过采用扩散模型,在去噪过程中实现低层 级的精细动作序列生成。Action Expert 结构上与 Latent Planner 类似,与 VLM 主干网络共享 Transformer 结构但使用独立 FFN 和投影矩阵。
GO-1 模型的特点包括:1)人类视频学习:可以结合互联网视频和真实人类示范进行学习,增强模型对 人类行为的理解;2)小样本快速泛化:具有较强泛化能力,能够在极少数据甚至零样本下泛化到新场 景、新任务,降低了具身模型的使用门槛,使得后训练成本非常低;3)一脑多形:有通用性,能够在 不同机器人形态之间迁移,快速适配到不同本体;4)持续进化:大模型搭配智元一整套数据回流系统, 可以从实际执行遇到的问题数据中持续进化学习。在模型效果方面,在五种不同复杂度任务的测试中相 较于对比模型,Go-1 平均成功率提高了 32%。GO-1 的推出是机器人 VLA 模型通用化发展的实例,展 现了机器人从完成特定任务的工具,向具备通用智能的具身智能体发展的可能性。
六、相关公司
1、理想汽车:从汽车到 AI,VLA 范式引领汽车智能化升级
营收体量增长,盈利能力逐渐修复。2024 年之前,公司营收规模高速增长并于 2023 年实现盈利, 24Q1,受 MEGA 上市不及预期和竞品影响,公司销量下滑导致净利润同比下降。之后公司迅速调整战 略,并在 24Q2 推出走量 SUV 车型 L6,在 L6 高销量带动下,公司 Q2-Q4 营收、净利环比逐渐改善。 25Q1 公司营收达到 259.3 亿元,同/环比分别为 1.14%/-41.44%;毛利率 20.51%,同比-0.1pct,毛利率 保持相对稳定。整体看来,公司增程基本盘顾虑已消除,AI+纯电产品周期将至,i 系列纯电车型有望抢 占 20-40 万家庭豪华纯电 SUV 市场高溢价份额,驱动整体销量增长。 公司转型人工智能企业已初见成效,VLA 范式有望引领汽车智能化升级浪潮。2023 年,理想汽车正式 提出 AI 化战略,明确提出“AI 定义汽车”战略方向,持续通过 OTA 升级车端智能化能力,23 年 12 月, 全量推送城市 NOA 并实现 Mind GPT 上车;24 年分别于 7、10、11 月全量推送无图 NOA、端到端 +VIM 架构、车位到车位智驾能力;2024 年 12 月,正式宣布从“智能电动车企业”转型为“人工智能企 业”,并提出其愿景“连接物理世界和数字世界,成为全球领先的人工智能企业”。
从 AI 发展的数据、算力角度,理想已具备整车企业第一梯队能力。数据方面,公司月销位居在新势力 品牌前列,截至 2024 年 12 月 31 日,理想智能驾驶累计里程达 29.3 亿公里,累计时长超 3382 万小时, 智驾用户数达到 110.9 万人,销量、里程数据有望形成“销量优势-数据积累-模型优化-体验提升-销量增 长”的闭环链路;算力方面,理想与火山引擎合作布局云端算力达 8.1EFLOPS,高云端算力支撑模型快 速训练迭代,端侧 Orin 芯片即将升级为 Thor-U 芯片,为模型在端侧部署提供更高算力基础。 2025 年 3 月,理想汽车推出下一代自动驾驶架构——Mind VLA,展示了公司由整车企业向 AI 企业转型 升级最新成果。能够认为,VLA 的正式推出与落地展示了公司成为全球领先人工智能企业的决心,短 期来看随着 VLA 的落地部署与优化,公司 2025 年实现 L3 有条件的自动驾驶,2025 年、2026 年逐步 将综合 MPI(城市+高速综合接管里程)提升至 500 公里、1000 公里以上的智驾目标有望逐步实现, 理想有望凭借 VLA 模型的工程部署先发优势引领汽车智能化升级浪潮。中长期来看,理想 Mind VLA 将成为公司具身智能基座模型,持续支撑理想空间、穿戴机器人业务乃至后续人形机器人等业务边界拓 展,助力公司实现 2030 年成为全球领先的人工智能企业愿景。
2、小鹏汽车:底层自研、全链自主打造“智驾端到端四部曲”
交付量增长,2025 年利润水平有望改善。2024 年公司交付新车 19.0 万辆,同比+34.2%,呈现稳健增 长态势。随着公司降本增效措施逐渐兑现,叠加与大众合作带来的经营改善,25Q1 公司营收达到 158.1 亿元,同比增长达 141.5%,毛利率 15.6%,同比增长 2.7pct。预计 25Q2 以来改款/新款车型上市有望 带动产品结构改善,叠加规模效应、技术+供应链降本的持续兑现,看好小鹏汽车后续利润水平改善趋 势。 智能化是小鹏汽车核心战略,坚持“底层自研、全链自主”实现智能化从跟随到局部领先的跨越。小鹏汽 车自成立伊始便将智能化作为核心战略,从传感器硬件到车端算力、从大模型算法到云端数据平台,小 鹏坚持“底层自研、全链自主”,通过持续性研发投入与闭环式研发迭代体系,小鹏在智能驾驶领域目前 已实现了从跟随到并跑、再到局部领先的跨越,智能化能力为其多品类车型的智能驾驶落地提供了坚实 技术保障,也持续赋能小鹏 Iron 人形机器人等新业务拓展。
算法研发方面,小鹏自动驾驶系统经历了从规则驱动到端到端大模型的多轮迭代。最初的 Xpilot 以规 则驱动实现 ACC 与 LCC 等基础巡航与泊车功能;2021 年小鹏汽车推出高速 NGP;2023 年推出城市 NGP 无图化版本,在全国范围内实现无高精地图覆盖;2024 年 XNGP+集成 BEV+Transformer 大模型, 打通感知-预测-规划三网,实现端到端一体化决策,并在 OTA 中持续迭代 XBrain 架构,支持环岛、掉 头及其他复杂场景,性能与鲁棒性不断提升;2025 年,小鹏智驾能力继续提升,720 亿参数规模世界 基座模型初步验证成功,预计后续将全面赋能小鹏 AI 体系全图谱,成为小鹏 AI 汽车、机器人、飞行汽 车等所有物理 AI 终端通用模型,此外小鹏 G7 首发智驾“大脑+小脑”VLA-OL 模型,实现全端侧运行, 标志着小鹏正式从“软件开发汽车”进入到“AI 开发汽车时代”。面向未来,小鹏已规划了自动驾驶技术的 “端到端四部曲”,即在 2025 年下半年推动云端大模型参数量相较于 2024 年版本提升约 5 倍,实现类 L3 级别(百公里接管<1 次)的高品质智能驾驶体验;最终在 Ultra 平台推出 Robotaxi,通过 AI Eagle Eye、XBrain、图灵芯片与云端模型工厂的协同,实现部分低速场景下的真正意义无人驾驶商业化运营。 算力建设进展顺利,以“图灵芯片”探路自驾 L3 时代。云端算力方面,小鹏已建成国内汽车行业首个万 卡智算集群,“云端模型工厂”拥有 10EFLOPS 算力,集群运行效率常年保持在 90%以上,从云到端的全 链路迭代周期平均可达 5 天一次。云端模型工厂不仅支撑了 XNGP+快速上线,也为未来“一键升级”更 大规模的生成式端到端大模型提供了算力保障。端侧算力方面,自研并成功流片“图灵”智驾芯片,该芯片采用 7nm 工艺,单颗芯片算力可达约 700TOPS,堪比三颗主流 Orin-X 芯片之和,自研端侧芯片一 方面将显著优化整车成本结构,另一方面也将为未来软件算法迭代提供更好硬件适配灵活性。
编辑:火腿肠- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 5 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 6 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 7 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 8 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 9 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 10 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 4 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 5 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 6 房地产行业专题报告:城市更新推动高质量发展.pdf
- 7 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 8 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 9 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 10 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 3 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 2026年中期医药生物行业投资策略:AI新药加速推进
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年7月A股回调归因与底部布局策略分析
- 2 2026年上半年小红书六大热门行业消费趋势洞察
- 3 2026上半年小红书六大热门行业消费数据洞察
- 4 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
- 8 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
- 9 2026年8月投资组合报告:从极致抱团到均衡修复
- 10 2026上半年国内AI剧漫剧行业数据报告
