物理AI产业链中世界模型的技术路线与数据层合成数据的作用是什么?

背景:物理AI被视为AI发展的下一个时代,其核心在于将AI与物理世界深度融合。当前业界对物理AI的发展路径存在多种探讨,特别是关于世界模型的技术分类及数据获取的挑战。

研究范围:请结合行业报告内容,详细阐述李飞飞提出的世界模型三类分类(渲染器、模拟器、规划器)及其代表模型特点,并分析物理AI数据面临的供需差距,以及仿真合成数据为何被视为物理AI发展的必经之路。

最佳答案 匿名用户编辑于2026/06/26 11:30

世界模型是物理AI发展的引擎,学界及业界对其定义不一。参考李飞飞的分类,世界模型能处理多模态输入,创造遵守物理定律的世界,并按输出分为三类:

第一类是渲染器,追求视觉保真,对三维结构没有显式理解,输出给人眼看的像素。代表模型如OpenAI Sora、谷歌Genie系列。其优势是训练数据相对易得、适用于Scaling Law,但不足在于不是真正理解世界,能力难以直接移植到机器人或决策系统中。

第二类是模拟器,关注物理结构,输出在几何、物理和动力学层面忠实的世界表征。代表包括英伟达Cosmos 1系列、World Labs Marble。该路线能更真实地还原世界,但难度和成本均更高。

第三类是规划器,给定观察和目标,输出“下一步该做什么”,指导物理载体与现实世界互动。代表模型如谷歌Gemini Robotics 1.5系列。其优势是可复用数字AI领域的技术积累,难点在于满足可靠性及海量训练数据需求。

目前,三类模型正相互融合进化为真正的世界模型,如英伟达Cosmos 3尝试用单一模型架构统一多种数据。此外,杨立昆提出的JEPA架构也是一种远期愿景,旨在建模“物理逻辑”。

在数据层,物理AI数据需求量远高于大语言模型。据觅蜂科技数据,全球高质量物理数据仅约50万小时,而GPT-5级别大模型训练语料折算超100亿小时,差距达数万倍。真机实采数据质量高,但绑定本体形态,成本高,难以规模化。基于真实数据的仿真合成数据可控制误差,覆盖长尾场景,边际成本低,可用于快速扩展训练规模。因此,仿真合成数据被视为物理AI跑通的必经之路,率先定义仿真环境和评测体系的系统有望成为物理AI时代的基础设施。

参考报告REPORT

传媒行业深度报告:物理AI,数据筑基,模型搭台,拔节起势在即.pdf

本文是开源证券发布的传媒行业深度报告,主题为“物理AI:数据筑基,模型搭台,拔节起势在即”。报告指出物理AI是将AI与物理世界感知、决策与执行系统深度融合的技术体系,对比数字AI具有更高的智能上限。科技大厂与金融资本密集加注,推动产业提速。应用层方面,自动驾驶从高端向全价位普及,具身智能机器人进入量产前夕,市场空间广阔。模型层方面,世界模型是发展引擎,分为渲染器、模拟器、规划器三类,正朝融合方向发展。数据层方面,物理AI数据需求巨大,真机数据稀缺,仿真合成数据成为关键基础设施。报告建议关注世界模型及数据采集涉及的3D仿真平台、真机实采设备等受益标的,包括海清智元、五一视界、索辰科技等。风险提示...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至