数字AI与物理AI边界解析:自动驾驶与机器人驱动物理智能产业化

  • 来源:东吴证券
  • 发布时间:2026/07/29
  • 浏览次数:23
  • 举报
相关深度报告REPORTS

汽车行业深度报告:AI系列深度03期,数字AI与物理AI的边界在哪里?.pdf

研究目的与核心命题本报告为东吴证券汽车行业AI系列深度第三期,核心命题是厘清数字AI与物理AI的边界。报告提出两者并非对称二分,更适合沿"物理闭环程度"连续理解;物理AI由英伟达2024—2025年推向产业主流,核心支柱为自动驾驶和具身/人形机器人,数字AI则是为区分信息空间智能而形成的追溯性对照词。核心差异与驱动力两类AI最根本差异体现在部署形态和安全约束:数字AI面向文本、代码和软件状态,高度依赖云端联网和重运营;物理AI面向车辆、机器人和真实空间,必须在端侧自主、安全攸关和实时反馈条件下运行,失败更可能直接造成不可逆物理后果。技术史上,数字AI主线是用通用方法、数据与算力替代人工设计,当...

物理AI与数字AI的概念界定与不对称性

数字AI与物理AI并非对称的二分概念,更适合沿"物理闭环程度"理解。物理AI承接具身智能学术传统,由英伟达及黄仁勋在2024—2025年从学术概念推向产业主流,核心支柱包括自动驾驶和具身/人形机器人;数字AI则是在物理AI概念流行后,为区分信息空间智能而形成的追溯性对照词。两者在数据形态、部署环境和行动后果上呈连续分布,而非孤立切分。

物理AI的学术分类可追溯至2021年Miriyev与Kovač的研究,其将AI区分为处理信号的数字AI与包含机器人等物理实体的物理AI。2024年黄仁勋在Hill & Valley Forum提出"感知AI—生成式AI—代理AI—物理AI"的阶段框架,2025年CES上系统阐述"AI的下一个前沿是理解物理定律、拥有身体的AI"。产业语境下,物理AI主要由自动驾驶(含端到端智驾与Robotaxi)和具身/人形机器人两大落地主线构成,共享端侧实时推理与云端训练的架构约束。

技术驱动力:通用方法扩展与物理闭环补足

数字AI的技术史主线是用更通用、更可扩展的方法持续替代人工设计。从1989年LeCun的LeNet系列确立梯度反传训练深度网络范式,到2009年ImageNet提供大规模标注数据基础,2012年AlexNet引爆深度学习,2017年Transformer以注意力机制取代循环与卷积成为GPT系列大语言模型的统一底座。Richard Sutton 2019年提出的"The Bitter Lesson"概括其底层逻辑:长期看,依赖算力增长的通用搜索与学习方法,往往胜过依赖人工注入领域知识的方法。当前重点从训练期扩参数转向推理期扩算力,OpenAI o系列和DeepSeek的强化学习后训练路线为代表,但向视觉、生成和物理闭环场景的迁移仍需验证。

物理AI更依赖产业场景中的持续试错和工程闭环。自动驾驶形成Waymo与特斯拉两条标志性路线:Waymo强调安全冗余,多传感器融合、高精地图、限定区域运营和模块化堆栈为早期核心,近年逐步用机器学习替换各模块,2024年提出基于Gemini的EMMA端到端研究模型;特斯拉强调纯视觉与可扩展,从HydraNet、BEV、占用网络到FSD v12以单一端到端神经网络从摄像头像素直接输出控制。两条路线共同趋势是从人工规则模块化走向数据驱动端到端,分歧主要在传感器配置、高精地图依赖和成本可扩展性。

机器人侧主线是视觉-语言-动作模型和数据飞轮。谷歌DeepMind 2023年发布的RT-2为早期代表性VLA模型,Physical Intelligence 2024年开源π0。机器人约束在于高质量交互数据稀缺,产业路径依赖"遥操作—训练VLA—部署—真实反馈"的数据飞轮。特斯拉以Optimus推进制造场景自用和量产降本,Figure以Helix主打人形通用操作,英伟达以Cosmos世界基础模型、GR00T人形VLA和Isaac仿真构建平台。

世界模型:共同关切与技术口径分歧

数字AI与物理AI都关心机器能否形成可预测世界或环境状态变化的内部模型,但两者口径并不相同。数字AI中的世界模型更多指向生成、推理与交互环境中的内部表征;物理AI中的世界模型更强调状态与动作后果预测,例如自动驾驶预判变道后周边车辆与行人的反应,机器人预判抓取力变化下物体如何移动。

两类路线在世界模型上存在生成式与表征预测式分歧。生成式路径以Sora、Genie 3、Cosmos、GAIA为代表,训练目标要求将潜在表示解码还原为可观测画面,可服务合成数据和仿真;表征预测路径以杨立昆JEPA为代表,主张在抽象表征空间预测且不重建像素,认为生成式视频会消耗过多容量于不可预测的像素细节。分歧实质在于:世界模型应重在生成,还是重在理解与规划、服务物理闭环控制。

商业化节奏:数字AI率先闭环,物理AI验证单位经济

商业化差异首先来自部署形态。多数通用数字AI服务主要在云端推理,依赖联网、低延迟和持续运营;物理AI则相反,自动驾驶避障决策和机器人抓取控制属于安全要求高、反应时间短的实时任务,关键推理必须在端侧本地完成。由此派生两类差异:物理AI对实时低延迟和可靠性要求更高,单次失误可能造成物理伤害;端侧需处理大量传感器数据,隐私和带宽约束更强。

数字AI中,编程是商业化最清晰的场景,代码可通过编译和测试即时验证,头部产品年化运行收入合计已达数十亿至百亿美元量级,Cursor、Claude Code、GitHub Copilot为代表,收费以按席位订阅为主。对话与搜索用户规模最大,但单用户变现较低,推理成本随使用量上升。企业级与Agent场景嵌入既有工作流并形成可度量ROI,为商业变现主战场,Anthropic收入结构中企业客户占比较高。营销与内容生成的最大变现来自大厂将生成式AI嵌入既有广告和内容产品,Meta财报显示其AI广告工具年化收入已超数百亿美元。

物理AI中,自动驾驶是商业闭环最靠前的落地场景。Robotaxi已进入区域内真实收费运营阶段,Waymo、百度萝卜快跑、小马智行等均披露车队规模、订单量或收费收入增长数据,收费模式基本明确,按里程和时长计价,但行业整体仍处投入期,盈利能力取决于单车成本、利用率、运营区域密度和安全监管等变量。人形/具身机器人按细分场景成熟度递减:工业/制造环境结构化最先落地,物流/仓储次之,导览巡检等商用服务已有零散落地,家庭场景仍不成熟。收费模式尚在分化,除整机买断外,RaaS按月或按小时租赁开始出现,但多数厂商尚未跑通可持续单位经济。

中美格局与AGI交汇:机器人成为路线汇合点

数字AI方面,美国在前沿模型能力与商业变现上领先,闭源前沿模型仍定义能力上限;中国以工程效率、开源生态、成本与用户规模追赶,DeepSeek以MoE、MLA、FP8、GRPO等创新代表效率范式,豆包、通义等消费级应用用户规模较大。自动驾驶方面,美国Waymo在纯技术成熟度与无人驾驶里程上领先,十年先发带来技术与监管壁垒;中国在规模化运营、成本和政策开放上具备优势,萝卜快跑已在多城开展规模化收费运营,华为、Momenta等渐进式量产智驾路线形成中国特色路径。人形/具身机器人方面,美国在具身基础模型和资本投入上领先,中国在出货量、供应链配套和硬件成本上领先,宇树、智元形成头部格局。

从通往AGI的视角看,机器人正成为数字AI与物理AI的交汇点。数字AI阵营中,OpenAI在2025年重建机器人部门,谷歌DeepMind推出Gemini Robotics,英伟达以GEAR实验室和GR00T押注具身智能,李飞飞从视觉转向空间智能与World Labs;物理AI阵营包括Physical Intelligence、特斯拉Optimus、Figure、波士顿动力,以及中国的宇树、智元等。这一汇合具备三重逻辑:物理接地假设——越来越多机构认为纯数字模型不足以达到稳健AGI,智能需要在与物理世界的交互中被检验和塑造;世界模型是共同关切,机器人是验证环境预测、动作规划和任务泛化的直接场景;物理世界数据稀缺,模型需要通过真实机器人和数据飞轮采集交互数据,突破仅依赖互联网语料的瓶颈。但汇合并不意味着路线一致,MLLM、世界模型和控制系统的联合架构是重要方向之一,其路径与时间表仍存在高度不确定性。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至