2026年7月汽车行业AI深度:从数字AI通用底座到物理AI真实世界闭环

  • 来源:东吴证券
  • 发布时间:2026/07/28
  • 浏览次数:25
  • 举报
相关深度报告REPORTS

汽车行业深度报告:AI系列深度01期,从数字AI通用底座到物理AI真实世界闭环.pdf

研究目的与核心框架本报告为东吴证券汽车行业AI系列深度开篇,围绕"怎么看AI、数字AI如何崛起、物理AI如何落地"三问展开,以智能驾驶为主线,系统分析从数字AI通用底座到物理AI真实世界闭环的技术演进与产业路径。数字AI:Transformer成为通用底座复盘AI两次爆发:第一次以CNN、RNN等专用架构分别攻克单点任务,2012年AlexNet为标志,2016年前后进入瓶颈;第二次以Transformer为核心,以"注意力+位置编码"提供跨领域通用关系建模,叠加Scaling规律,推动语言、视觉、生成、多模态四大智能由分立走向统一。Transformer角色由能力跃升来源转变为跨领域通用计算...

数字AI与物理AI的技术同源性及演进分野

人工智能发展已形成两条并行主线。数字AI以Transformer为核心架构,在语言、视觉与多模态任务中跑通通用底座模型,但其本质处理的是离散符号与数字信号,难以直接实现物理世界的建模闭环。物理AI则需在连续、实时、安全约束的真实世界中建立"感知—行动—反馈—优化"的完整闭环,自动驾驶是当前最具代表性的落地场景。二者技术同源但路径分化:数字AI的价值在于确定性,物理AI承载本轮AI发展的更大增量弹性。

Transformer如何收敛为数字AI通用底座

数字AI的崛起经历两次爆发。第一次爆发以CNN、RNN等专用架构分别攻克视觉与语言任务,归纳偏置强但通用性受限,2012年AlexNet在ImageNet上的突破标志着深度学习范式确立,至2016年前后CNN进入学术瓶颈期,产品落地窗口开启。第二次爆发由Transformer驱动,其核心机制在于以"注意力+位置编码"提供跨领域通用的关系建模,叠加Scaling规律后,统一模型在能力迁移、研发效率与工程复用上的优势持续扩大。

从技术演进看,Transformer的渗透遵循特定路径:在语言任务中作为原生主干快速确立地位;在视觉任务中经ViT的patch token化引入,长期与CNN并存;在生成任务中分环节渗透,从序列生成到条件注入再到替代U-Net骨干;在多模态任务中对齐位置逐步前移,从后期外挂到预训练统一再到端到端实时。最终,语言、视觉、生成与多模态四大智能领域的技术路径均收敛于Transformer统一基础模型范式,其角色由"能力跃升来源"转变为跨领域通用计算底座。

物理AI面临的三大系统性差异

物理AI早期主要迁移Transformer架构理念,当前VLM、VLA进一步建立在LLM及多模态基座之上,但数字AI红利已接近阶段性瓶颈。根本原因在于三类核心差异:其一,物理世界缺乏天然Token,文本的轻量分词方案无法直接套用,需以BEV、Occupancy、VAE与3D编码器等重型网络自主构建物理世界表征;其二,长尾、极端场景天然稀疏且采集成本高,难以复制互联网数据的Scaling路径,兰德公司测算表明以传统路测证明自动驾驶安全性需数百亿英里量级;其三,模仿学习受限于人类驾驶上限,当安全目标要求超越人类平均水平时,强化学习成为突破能力边界的关键路径。

VLA范式:从端到端到动作生成的升级

自动驾驶技术演进经历四阶段:经典模块化流水线、端到端统一策略、VLM4AD感知解释、VLA4AD动作生成。VLA的核心变化在于通过显式动作头弥合"能解释场景却难以直接生成可靠控制决策"的缺口,将视觉感知、语言理解和控制决策整合到同一策略中。

VLA内部演进可划分为四阶段:预VLA阶段多模态大模型充当被动解释器;模块化VLA阶段LLM升级为主动路径规划媒介;统一端到端VLA阶段在一次前向传播中直接映射多模态传感器流与语言指令为控制信号;推理增强VLA阶段将长时域推理、记忆与交互整合进控制循环。头部厂商路线已出现分化:Waymo EMMA构建于Gemini之上引入思维链推理;理想MindVLA采用3D高斯中间表征与Diffusion扩散解码器实现车端实时运行;小鹏第二代VLA去掉语言转译环节,设计原生多模态Tokenizer实现视觉到动作的直接输出。

世界模型:物理AI闭环的核心枢纽

世界模型在物理AI中承担三重角色。在表征层面,通过预测未来提供海量自监督信号,JEPA路线主张在潜在空间而非像素空间做预测,竞争壁垒正从单个感知模块精度前移至如何把物理世界嵌入统一、可预测的潜在空间。在数据层面,世界模型成为"数据工厂",以生成式方法规模化制造长尾与极端场景,特斯拉、Waymo、英伟达Cosmos、Wayve GAIA-2等代表性系统相继发布,但通用视频生成能力尚不能直接等同于可被安全闭环依赖的数据工厂,长时程一致性仍是反复强调的难点。在训练层面,世界模型为强化学习提供可控、可重置、可注入危险事件的闭环试错环境,理想"重建+生成"统一世界模型、华为乾崑ADS4云端世界引擎等实践表明,重建式方法符合物理约束但新视角泛化受限,生成式方法泛化较强但物理约束不足,两者结合方能得到既符合物理规律又具泛化能力的环境。

强化学习:从可选增强到闭环关键

数字AI与物理AI中强化学习的角色存在显著分化。大语言模型的预训练模仿互联网级人类知识,强化学习更多承担对齐与推理增强;自动驾驶模仿对象为平均水平人类司机,而安全性目标要求大幅超越人类,多家机构公开表述指向同一判断——预训练模仿可将系统能力推升至约80分,而从80分提升至95分需要强化学习。代表性厂商实践正收敛为"端到端之上叠加强化学习后训练"的共识:特斯拉FSD v14在模仿外引入更激进RL,小鹏720亿参数世界基座经后训练与蒸馏生产车端模型,Momenta R6/R7飞轮大模型在世界模型中做RL,地平线HSD采用"一段式端到端+强化学习"。

云车部署分离:训练最优不等于部署最优

经典Scaling Law以训练损失最小化为目标,未将推理成本与实时时延纳入约束。智能驾驶把车端部署约束推向更高强度:需在固定车规算力上以不低于30Hz运行大型视觉Transformer叠加大语言模型。当前量产大模型实际推理帧率仍低于参考水平,理想VLA约10Hz、NVIDIA Alpamayo-R1约10Hz、小鹏第二代VLA压缩至80ms以内。

云端压缩与车端压缩形成不同效率工具箱。云端侧重稀疏激活、注意力/缓存压缩、低精度与投机解码:DeepSeek-V3以671B总参仅激活37B,MLA将KV缓存压至约70KB/Token;面向驾驶还发展出视觉Token剪枝与隐式/动态Token替代冗长思维链。车端侧重蒸馏上车、快慢双系统分离与推理工程优化:Waymo以基础模型适配三类大教师再安全蒸馏为车端学生,理想以约32B多模态基座经RL与蒸馏压缩为约4B车端VLA,快慢架构从卡尼曼"思考快与慢"双系统演进为统一VLA框架。

物理AI的发展方向与产业判断

物理AI正从复用数字AI能力转向补齐自身底层能力,形成区别于数字AI的独立而统一的发展方向。世界模型或成为突破瓶颈的核心抓手:向前完成潜在空间表征,向中游生成高价值长尾数据,向后为强化学习提供可规模化试验环境,形成"表征—数据—学习"闭环。随着表征向潜在状态收敛、VLA持续演进、世界模型与强化学习闭环走向成熟、云车部署逐步兑现,物理AI有望由能力展示走向大规模落地,成为AI发展当前阶段最具成长弹性的方向。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至