2025年具身智能数据行业分析报告:AI时代的石油

  • 来源:东吴证券
  • 发布时间:2025/06/06
  • 浏览次数:375
  • 举报
相关深度报告REPORTS

具身智能数据行业分析报告:AI时代的石油.pdf

具身智能数据行业分析报告:AI时代的石油。数据是推动具身智能技术快速突破和落地应用的关键。借鉴自动驾驶汽车发展的路径,数据对于具身智能同样至关重要。优质的数据集能够驱动智能体感知与理解环境,能够加速具身智能模型的训练与部署,帮助机器人有效完成复杂任务。不同于大语言模型可以使用互联网海量信息作为训练数据,机器人所用的具身智能模型没有现成数据可以使用,需要投入大量时间和资源进行机器人操作实践或仿真模拟,以收集视觉、触觉、力觉、运动轨迹以及机器人本体状态等多源异构数据。符合通用标准、得到验证的数据集成为具身智能行业的刚需。当前具身智能本体形态多种多样,应用场景千差万别,对于具身智能训练数据的需求也更...

具身智能数据集基本概念

具身智能的世界级难题:数据

具身智能四个最关键的因子:算法、算力 、机器人硬件、数据。 算法层面:ChatGPT、Deepseek、通义千问等一系列领先的模型,在算法层面国内处于引领地位。 算力层面:国外以英伟达、AMD为代表,国内以寒武纪、海光信息、地平线等公司为代表,正在快速突围。目前在训练阶段的算力瓶 颈已经解决。 机器人硬件层面:中国目前具有丰富的产业链。  数据层面:目前仍是世界级难题,如何给机器人提供用来训练的可交互的数据是未来具身智能工作的重点之一。

具身智能浪潮来袭,数据供给瓶颈亟待突破

数据是推动具身智能技术快速突破和落地应用的关键。借鉴自动驾驶汽车发展的路径,数据对于具身智能同样至关重要。优质的数据 集能够驱动智能体感知与理解环境,能够加速具身智能模型的训练与部署,帮助机器人有效完成复杂任务。

目前高质量、多样化的数据集仍旧稀缺。不同于大语言模型可以使用互联网海量信息作为训练数据,机器人所用的具身智能模型没有 现成数据可以使用,需要投入大量时间和资源进行机器人操作实践或仿真模拟,以收集视觉、触觉、力觉、运动轨迹以及机器人本体 状态等多源异构数据。符合通用标准、得到验证的数据集成为具身智能行业的刚需。当前具身智能本体形态多种多样,应用场景千差 万别,对于具身智能训练数据的需求也更为多元。目前业内仍有部分数据集主要聚焦在特定机器人、特定场景和特定技能等方面,在 整体通用性上有待提升。因此,构建高质量、多样化的感知数据集是不可或缺的基础工作,这些数据集不仅为算法训练提供了丰富的 素材,也成为了评估具身性能的基准参考标准。

数据集的标准和有效也同样重要。作为训练具身智能大模型的重要原料,数据集采集是否符合标准、在训练上是否“能用”、“好 用”,是否能更有效支持模型泛化,已经成为机器人变“聪明”的关键。

数据采集的价值和难点

数据采集的关键价值包括: ① 促进通用智能形成:具身数据支持机器人在复杂环境中实现通用任务能力,是类人智能演化的基础; ② 增强环境理解能力:比起图像识别等静态数据,具身数据可捕捉动态交互、物体变化、力学反馈等多维信号; ③ 支持任务迁移与泛化:不同场景中的具身体验数据,有助于提升模型从特定任务向通用任务的迁移能力; ④ 提升实时决策能力:通过感知-理解-反馈数据闭环,机器人可实现即时调整与精准操作。

机器人数据分为真实数据和仿真数据两类

具身智能数据按采集方式主要分为真实数据和仿真数据两大类。 (1)真实数据:真实数据是智能体通过自身物理身体上的各类传感器(如摄像头、麦克风、触觉传感器等 ),在与真实物理环境进行交 互过程中,实时采集获取的数据。真实数据主要来源有:机器人遥操(通过人工远程操控获取真实场景下的操作数据)、动作捕捉(记录 人类在特定环境中的行为模式)。 (2)仿真数据:借助计算机模拟技术,在虚拟环境中生成的、用于训练具身智能的数据。通过构建虚拟场景、物体和智能体,模拟智能 体与虚拟环境的交互过程来产生数据。即利用仿真环境生成训练数据。 两者关系:仿真数据不会取代真实数据,两者是互补关系。未来训练将大量混合使用真实数据和高质量的合成数据。 仿真数据的优势是低成本、高效率、可控性强、多样性高,缺点是真实性始终有限,无法完美还原物流世界。真实数据的作用是保证 最终模型在真实世界中的可靠性和泛化能力。 短期来看,仿真数据用于解决简单任务,助力具身智能实现0到1的突破。尤其针对跑步、跳跃或者跳舞等简单的运动任务,仿真数据 已经足够支撑。反正数据的优势在于获取快、成本低且数据量大。 长期看,真实数据对处理复杂任务不可或缺,推动具身智能实现1到N的深度应用。

国内外具身智能真实数据集现状

丰富的高质量具身智能数据集

当前具身智能机器人数据多为厂商自采集。当前给人形机器人采集的高质量数据通常在现实世界中获取,采集方式主要有直接接触数 据(真机数据)和间接接触数据(人工控制数据)两种。最理想的数据采集方式是通过人形机器人本体直接触达物理世界,让其准确 理解真实环境。但是,大规模真机数据的采集成本高昂,需要投入许多人力、物力和时间资源,数据标注和采集设备都存在门槛。与 此同时,物理世界的运行规律错综复杂,数据的采集往往难以全面反映所有相关的物理现象与知识。 目前市面上存在丰富的高质量具身智能数据集,具备丰富的演示数量、场景任务和动作技能等。

智元:AgiBot World百万级机器人数据集

智元机器人携手上海人工智能实验室、国家地方共建人形机器人创新中心以及上海库帕思,正式开源Agibot World项目。AgiBot World是全球首个基于全域真实场景、全能硬件平台、全程质量把控的百万真机数据集。AgiBot World数据集中涵盖的场景具备多样 化和多元化特点,从抓取、放置、推、拉等基础操作,到搅拌、折叠、熨烫等复杂动作,几乎涵盖了人类日常生活所需的绝大多数场 景。

AgiBot World包含来自100个机器人的100多万条演示轨迹。在长程数据规模上已超过谷歌OpenX-Embodiment数据集十倍。相比Google 开源的Open X-Embodiment数据集,AgiBot World长程数据规模高出10倍,场景范围覆盖面扩大100倍,数据质量从实验室级上升到工 业级标准。

技能:AgiBot World数据集涵盖了家居(40%)、餐饮(20%)、工业(20%)、办公室(10%)、超市(10%)等上百种通用场景和 3000多个操作对象。相较于国外广泛使用的Open X-Embodiedment数据集和DROID数据集,AgiBot World数据集在数据时长分布上显著 提升,其中80%的任务均为长程任务,任务时长集中在60s-150s之间,并且包含多个原子技能,长程数据是DROID和OpenX-Embodiment 的10倍以上,3000多种物品基本涵盖了这五大场景。

数据采集:AgiBot World基于全身可控的移动式双臂机器人进行数据采集,配备了视觉触觉传感器、六维力传感器、六自由度灵巧手 等先进设备,可用于模仿学习、多智能体协作等前沿研究。智元Genie-1机器人包括8个环绕式布局的摄像头,实时360度全方位感知; 6自由度灵巧手,末端六维力传感器和高精度触觉传感器;全身拥有32个主动自由度。

国地共建机器人创新中心:RoBoMind数据集

2024年12月27日,国家地方共建具身智能机器人创新中心与北京大学计算机学院联合推出了一个大规模多构型具身智能数据集和 Benchmark——RoboMind,基于成型标准采集,经多个模型训练验证有效,支持多本体多任务并具备通用性,充分解决了目前全球开 源数据集,量大但数据质量参差不齐、通用性复用性差、部分数据实测效果不理想等问题,有效满足复杂场景具身智能高效率和针对 性的训练。

创新中心发布的RoboMind数据集,采用了包括含单臂机器人、双臂机器人、人形机器人,手臂末端使用夹爪或者灵巧手等多种形态的 机器人本体进行数据采集,包含了涉及279项不同的任务多类场景,涵盖了高达61种不同的物体,覆盖了家居、厨房、工厂、办公、 零售等大部分生活服务场景,对科研突破和场景应用均十分友好。创新中心持续采集长程复杂任务,目前已经积累数十万条高质量数 据,以真机数据为主,配以仿真遥操作数据。在数据质量与使用价值上,一条数据等同于目前现有数据集的多条存量数据。创新中心 计划首批开源10万条,后续逐步释放,涵盖更多机器人本体和场景任务。

国内外具身智能仿真数据集现状

仿真数据:场景生成引擎的两种技术路径

机器人仿真数据主要依赖虚拟场景,而场景的合成方案可拆解成两个关键部分:场景生成(Gen)与模拟(Sim)。 场景生成引擎(Gen)主要有两种技术路径: 合成视频+3D重建:基于像素流驱动,先生成视频或图像,再重建为点云或mesh等非结构化3D数据,最终转为结构 化语义模型。如Hillbot、群核科技、World labs(李飞飞)等。 AIGC直接合成3D数据:利用图神经网络(GNN)、扩散模型(Diffusion)、注意力机制(Attention)等方法,直接 合成结构化空间数据。如 ATISS、LEGO-Net、DiffuScene、RoomFormer 等代表模型,部分方案结合程序化生成技术, 如 Infinigen(CVPR 2024)。

路线一:视频合成+3D重建

合成视频+3D重建:基于像素流驱动,先生成视频或图像,再重建为点云或mesh等非结构化3D数据,最终转为结构 化语义模型。如Hillbot、群核科技、李飞飞“World Models”项目等。

路线二:端到端的3D直接生成

端到端3D合成数据:利用图神经网络(GNN)、扩散模型(Diffusion)、注意力机制(Attention)等方法,直接合成结构化空间数 据。 端到端3D算法优势:稳定性强、高效低成本、信息完整、控制性强、可拓展性强。

群核科技:空间智能领军企业

群核科技的SpatialLM和SpatialVerse是该路线的代表性技术。群核科技成立于2011年,是一家以AI技术和GPU集群为底座的空间智能 企业,公司构建了一套物理正确的世界模拟器,并运用在室内空间场景下的实时渲染、工业生产制造,以及虚拟物理世界训练等场景。 公司旗下拥有空间设计软件【酷家乐】、海外版产品【Coohom】、面向室内环境AI开发的下一代空间智能解决方案【群核空间智能平 台】(SpatialVerse)以及空间理解模型SpatialLM等。

SpatialVerse为机器人提供优质的数据服务。群核科技推出的空间智能解决方案SpatialVerse 构建了庞大且物理正确的数据集库, 模仿真实世界物理特性和空间关系,通过合成数据方案为机器人搭建起接近物理真实的“数字道场”,帮助机器人在仿真环境下完成 例如叠被子、递送水杯、开关冰箱门等行动的交互训练。

智元:推出AgiBot Digital World仿真框架,助力仿真数据生成

2025年2月25日,智元机器人宣布出自主研发的大型仿真框架AgiBot Digital World,为机器人操作提供灵活的仿真数据生成方案、 预训练的大规模仿真数据和统一的模型评测标准,同步开源海量仿真数据! AgiBot Digital World作为一款专为机器人操作技能研究与应用设计的仿真框架,集成了海量的逼真三维资产、多样化的专家轨迹生 成机制和全面的模型评估工具。通过高保真地模拟训练场景,全链自动化地生成数据。 智元机器人开源上线海量规模的仿真数据集AgiBot Digital World Dataset,涵盖5大类场景、180+品类具体物品、9种常见材质、12 种核心技能,具有质量高、泛化快、任务多样、应用灵活的特点。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至