2024年机器人行业专题报告:机器人的大脑,具身智能

  • 来源:国泰君安证券
  • 发布时间:2024/08/21
  • 浏览次数:1190
  • 举报
相关深度报告REPORTS

机器人行业专题报告:机器人的大脑,具身智能.pdf

机器人行业专题报告:机器人的大脑,具身智能。 2024年人形机器人最具突破性的进展主要体现在具身智能领域:3月,Covariant发布端到端具身大模型RFM-1,具身智能创业团队SergeyLevine和ChelseaFinn创立Pi(PhysicalIntelligence),FigureAI发布接入OpenAIGPT-4V的Figure01demo。4月,李飞飞创立WorldLabs,致力于解决AI在三维空间感知和理解方面的难题。5月,特斯拉发布视频,展示Optimus精准分拣特斯拉电动车4680电池的场景,使用完全端到端神经网络,只利用2D摄像头视频和机载自传感器,直接生成关节...

1. 具身大模型:能够理解三维物理世界的模型

1.1. 非具身大模型 vs 具身大模型:是否可以生产运动姿态

从物理空间的角度来划分,大模型可以分为非具身大模型(基础大模 型)、具身智能大模型(机器人大模型),它们的区别是能否生成运动 姿态。 (1) 非具身大模型:代表的模型有 GPT、Sora、文心一言、通义千 问等,这类模型输入的是语言、图片和视频,输出的模态是语 言、图片和视频。大模型采取 Transformer 架构,以与训练+微 调的形态有效摆脱对基于场景数据训练的依赖,解决了长距离 信息关联的问题。在人形机器人的应用,大模型集成了多模态 的感知模块,大幅提升了机器人额环境感知和人机交互,上层 规划的能力。 (2) 具身大模型:以自动家数大模型和机器人大模型为代表,如 Tesla FSD、谷歌 RT、RFM-1、ViLa 和 CoPa 等,具身大模型 输入的是视觉、语言信号,输出的是三维物理世界的操作。

1.2. 具身大模型:端到端&分层端到端

具身智能大模型主要有两个路径: (1) 端到端的具身大模型,以谷歌的 RT 模型为代表; (2) 基于 LLM 或 VLM 的具身分层大模型,大多数的机器人公司都 采取了这个方案,典型代表有:Tesla FSD,Figure AI,星海 图,银河通用,智元机器人等。

端到端的大模型同时训练决策和操作,直接端到端地实现从人类指令 到机械臂执行,其特点有:1)需要大量真实长任务数据才能有效,且 要覆盖所有可能的任务,所需的数据量估计需要达到万亿级别。以谷 歌的 RT 模型为例,谷歌花了上千万美金 16 个人耗时 17 个月收集得到 了 13 万条厨房数据训练 RT,模型在厨房表现很好,但除了厨房成功 率却骤降至 30%。泛化性难其实一定程度上是由于数据采集没有做到 scalable。归根到底是由于机器人的物理数据不如互联网图像/文本数据 那样大量且易得,与自动驾驶这一单一任务相比,如果每种任务都需 要自动驾驶那么多数据、这一数据量要大得多。2)推理速度慢。RT2 采用的 LLM 是谷歌的 PaLM-E,频率 1-3Hz,响应速度 0.3s~1s。

1.3. 主流方案:分层端到端,典型代表 Figure AI

由于端到端大模型目前面对局限性,因此目前大多数的机器人公司都 采取了分层端到端的方案,通过决策大模型和操作大模型的相互配 合,分层端到端的方法需要的训练数据相对较少,能够完成各种新任 务。多层端到端大模型的上层是多模态通用大模型,可以调度中间技 能 API,来实现完整的从任务的感知、规划到执行的全流程;中间层 是决策大模型(任务/运动规划),通过数据训练的泛化的技能,包括 自主建图、自主导航、物体抓取、开门开抽屉开冰箱、移动操作、挂 衣服叠衣服柔性物体操作的泛化技能;底层是硬件驱动执行算法,实 现机器人的平衡,实时精准的运控。

典型代表:Figure 02 采取了基于 VLM 的分层大模型。在 Figure 发布 的演示中,Figure 01 能理解周围环境,流畅地与人类交谈,理解人类 的需求并完成具体行动,包括响应人类想吃东西的问题递过去苹果, 然后一边将黑色塑料袋收拾进框子里一边解释递苹果的原因,将杯子 和盘子归置好放在沥水架上。在 Figure 01 的视频里,OpenAI 提供了 视觉和语言理解能力,而 Figure AI 则提供了机器人的动作规划和控制 能力。OpenAI 和 Figure 合作用的小模型,动作输出频率 200Hz,从 Figure 01 的 Demo 视频展示中,响应速度几乎没有延时。Figure 02 搭 载了机载的视觉语言模型(VLM),通过机载麦克风和扬声器,实现了 与人类的高效对话,具备了快速的常识性视觉推理能力,能够自主执 行多种复杂任务。

典型代表:银河通用采取三层大模型系统。底层是硬件层,中间层是 些响应快小模型(如:三维感知、自主建图、自主导航、物体抓取、 开门开抽屉开冰箱、移动操作、挂衣服叠衣服、柔性物体操作等),上 层是用来做推理慢的做任务规划的大语言模型 LLM。当得到指令, LLM 负责分析,安排调度哪个小模型 API。小模型执行完后,LLM 分 析结果,研究下一步该怎么做。

2. 具身大模型的主流方案:分层端到端

2.1. 基础大模型:LLM&VLM

大模型采取 Transformer 架构,以与训练+微调的形态有效摆脱对基于 场景数据训练的依赖,解决了长距离信息关联的问题。在人形机器人 的应用,大模型集成了多模态的感知模块,大幅提升了机器人额环境 感知和人机交互,上层规划的能力。Figure01 采用 OPEN AI 的多模态 大模型,类似于 RT-1+PaLM-E 的模型融合。

2.2. 决策大模型:从 LLM 向 RL 演进

决策智能面临开放变化环境情况下的泛化问题,决策大模型使用大模 型解决决策任务中的环境变化、开放环境、策略泛化性问题。其核心 任务是基于任务理解,自动生产运控指令,为操作模块提供指令输 入,也就是将复杂的任务分解为一系列动作指令,然后交由操作大模 型逐一执行。 以 ChatGPT for Robotics 为例,将 prompt 封装成函数或类,将复杂 任务拆解为子任务序列,并逐步调用相应的 prompt,生成 python 代 码指令。首先,定义一组高级机器人 API 或函数库。该库可以针对特 定的机器人类型进行设计,并且应该从机器人的控制栈或感知库映射 到现有的低层次具体实现。为高级 API 使用描述性名称非常重要,这 样 ChatGPT 就可以推理它们的行为。接下来,为 ChatGPT 编写一个 文本提示,描述任务目标,同时明确说明高级库中的哪些函数可用。 提示还可以包含有关任务约束的信息,或者 ChatGPT 应该如何组织它 的答案,包括使用特定的编程语言,或使用辅助解析组件等。再次, 用户通过直接检查或使用模拟器来评估 ChatGPT 的代码输出。如果需 要,用户使用自然语言向 ChatGPT 提供有关答案质量和安全性的反 馈。最后,当用户对解决方案感到满意时,就可以将最终的代码部署 到机器人上。示例: 输入指令“将苹果放入碗中”,决策大模型将输出 一系列动作指令,包括“识别苹果”、“抓取苹果”、“识别碗”和“放 置苹果于碗内”。

谷歌 PaLM-E 是一个用于体现推理任务、视觉语言任务和纯粹语言任 务的单一通用多模态语言模型。PaLM-E 基于丰富的多模态模型知识对 任务进行理解和处理,并分解成待定的机器人指令,RT-1 将代堆的机 器人指令转化为机器人控股指令,模型将较为复杂的任务分解成简单 的不走完成,并且具备了更强的抗干扰性和知识能力。 决策大模型的两种范式主要围绕大语言模型(LLM)展开,结合不同 的技术和方法,以实现更高效的决策过程: 范式 A(LLM):以基于深度学习的大语言模型为中心,配合 API 选 择和其他技术手段,实现决策过程的优化。这种范式利用大语言模型 处理自然语言任务的能力,如文本分类、问答、对话等,作为通向人 工智能的重要途径。大语言模型通过大量文本数据训练得到,能够生 成自然语言文本或理解语言文本的含义,处理多种自然语言任务,并 在多个基准测试上表现出色。这种范式的应用通常需要掌握 Python 编 程知识、神经网络的知识以及深度学习框架,以便更有效地使用这些 大语言模型进行训练和推理。 范式 B(RL):基于强化学习的范式,使模型能够在不同环境和任务 中学习和适应,实现更高级的决策能力。通过学习额外的一个价值函 数,使得能够大致知道往哪边去搜索,哪些行动最终会带来好的结 果,哪些会导致不好的结果。在这种比较庞大的决策树下,引导大语 言模型做出相关的决策,通过前瞻技术产生当前可以有的更好的行 动。这种范式不仅仅是基于一个已经被训练好的大语言模型,更多的 是一个强化学习的框架,通过训练过程的不同,使得模型能够在不同 的任务上做出泛化,实现 goal condition reinforcement learning,而不是 使用单一的奖励函数。这种范式的训练过程与一般的强化学习有所不 同,因为它希望模型能够在不同的任务上做出泛化。

2.3. 操作大模型:从“MPC+WBC”向“RL+仿真”演进

操作大模型是根据决策大模型的输出执行具体动作,如“抓取”、“打 开”、“旋转”等。与决策大模型不同,操作大模型需要与机器人硬件 深度集成,且必须通过数据采集来实现。运动控制算法的演进:基于 模型的控制和算法——MPC+ WBC——RL+仿真模拟。MPC 更适合具 有精确模型和短期优化目标的场景,RL 更适用于不确定性高、需要长 期学习和自适应的环境。

模型预测控制(MPC)与全身控制(WBC)结合:MPC 根据用户和 控制器指定计算反作用力和位置命令,将计算结果传递给关节控制 器,通过驱动硬件的伺服系统和关节,实现全身运控。任何为机器人 控制系统的驱动关节产生控制信号的操作都可以叫做 WBC。控制系统 框图如下所示,1)构建并求解基于质心动力学建立的非线性模型预测 控制器(NMPC),用于规划机器人质心和四肢的运动轨迹。其中 NMPC 的代价函数为系统状态误差的加权平方与系统输入的加权平方之和, 其约束包括足端作用力在摩擦锥内、足端触地速度为零和摆动腿的 Z 轴轨迹追踪。2)将追踪的状态变量定义为一组带优先级的轨迹跟踪任 务(WBC),求解以生成机器人驱动关节的控制信号。WBC 建立的任务 有运动方程、质心状态追踪、关节力矩限幅等。3) 使用卡尔曼滤波器 融合 IMU 和驱动关节数据,得到机器人质心的位姿、速度和关节位 置、速度等状态,并反馈给 NMPC、WBC 控制器。

MPC 的局限性: (1) 在 MPC 模型预测滚动优化的过程其实是一个实时迭代的过 程,要求很大的计算量和计算时间。这就意味着 MPC 模型预 测其实适用于慢动态过程和具有高性能计算机的工作环境; (2) 现有的预测控制算法多数采用工业界易于获得的阶跃响应或脉 冲响应这类非参数模型,并通过在线求解约束优化问题实现优 化控制,对于约束系统无法得到解的解析表达式,这给用传统 定量分析方法探求设计参数与系统性能的关系带来了困难,使 得这些算法中的大量设计参数仍需人为设定并通过大量仿真进 行后验,因此除了需要花费较大的前期成本外,现场技术人员 的经验对应用的成败也起着关键的作用。 RL+仿真训练:可以让具身智能从环境中获得更优的状态,然后由智 能体做出决策,并对环境做出适当的行为反应。比较关心的是具体的 输入输出,对于物理交互任务来说:输入:1)状态:机器人的位置、 速度、加速度等运动学信息,以及可能包括的力反馈信息。这些信息 通过机器人的传感器(如编码器、力传感器等)获取。2)环境信息: 机器人所处环境的信息,如障碍物的位置、形状等。这些信息也可以 通过机器人的感知系统(如视觉系统、激光雷达等)获取。输出:1) 动作:机器人的运动指令,如速度、加速度、方向等。这些指令直接 控制机器人的运动。2)控制参数调整:在阻抗控制中,输出可能还包 括对阻抗参数的调整,如刚度、阻尼等。这些参数的调整会影响机器 人在与环境交互时的力反馈行为。

强化学习在具有力感知的机械臂操作任务中也存在问题: (1) 数据收集与标注问题:强化学习的方法去做控制机械臂抓取的 任务,需要大量的数据进行训练,但是通常没有足够多的真实 数据去训练强化学习模型,因为这不仅需要精确的力感知设 备,还需要进行数据收集和标注。所以最常见的做法就是用仿 真去产生大量的训练数据,训练数据越多强化学习模型才越鲁 棒。但是存在的一个问题是仿真图片和真实图像是有差距的, 在仿真环境里训练出来的 RL 模型可能在真实场景中应用的时 候并不那么好。 (2) 模型泛化能力:强化学习模型往往容易过拟合于特定的任务和 环境,导致其泛化能力受限。当面对新的任务或环境时,模型 可能需要重新进行训练和调整,这增加了应用的复杂性和成 本。 (3) 实时性与稳定性:强化学习算法在训练过程中可能会受到噪 声、延迟等因素的影响,导致实时性和稳定性下降。

3. 数据采集:具身智能最大的壁垒之一

3.1. 机器人场景数据主流采集方法:远程操作、仿真合成数 据

互联网上各类文本、图像和视频数据集庞大,但机器人的场景和交互有 价值的数据量相对较小,限制了 AI 模型在人形机器人上的泛化能力。 在 Coatue 的报告中提到,机器人场景数据集仅有 2.4M,远远低于文本 数据集的 15T Tokens 和图像数据集的 6B Images,相差好几个数量级。

机器人数据采集的方法有四种,目前主流的方法是远程操作和仿真: 1)远程操作:由实验人员操作机械手柄,远程控制机器人做出相同动作, 以此来积累数据。2024 年 5 月 5 日,Tesla Optimus 官方发布了新的 demo 视频展示了 Optimus Gen2 的最新进展,从视频中可以看到,Optimus Gen2 的训练数据通过人类远程操作收集,并针对各种任务进行扩展。 2)增强现实:在名为《Explainable Human-Robot Training and Cooperation with Augmented Reality》的研究中,研究人员通过 AR(增强现实)技术 让人机交互过程具备更强的可解释性,进行数据积累。 3)仿真(合成数据):通过海量算力进行模拟运算,计算得出海量机器 人训练数据集。仿真可能是目前最有可能做到规模化数据生成的路径, 背后需要巨大的算力支持。目前 Nvidia 采取的就是这条技术路径。 4)视频学习:通过多模态大模型,直接让机器人通过视频学习人类动作, 积累训练数据。

3.2. 远程操作+仿真合成数据,混合数据才是未来?

远程操作和合成数据都有其优缺点,Scale AI 首席执行官亚历山大·王: 提出,将远程操作+仿真合成数据结合,可能是未来主要的数据采集方 式。远程操作可以在复杂或危险的环境中收集数据,其优点是数据收集 的准确性高,可以获得高质量的数据。缺点是难以规模化,泛化性较差; 需要专业的操作人员,成本较高;受到通信延迟和带宽的限制,可能会 影响数据收集的实时性。使用仿真技术综合生成训练数据,其优点是可 以在虚拟环境中进行数据收集,避免了实际操作中的风险和成本;可以 模拟各种不同的情况和场景,收集更加全面和多样化的数据。缺点是模 拟数据可能与实际数据存在一定的差异,需要进行验证和校准;模拟环 境的构建需要一定的技术和时间成本。标注和测试数据公司 Scale AI 首 席执行官亚历山大·王:提出“正在探索混合数据的方向,结合使用合 成和非合成数据,混合数据才是真正的未来。”

特斯拉 Tesla Bot 开发团队使用人类的真实运动方式来训练机器人,为 人工智能机器人提供现实生活中人类的真实运动数据。特斯拉 Optimus 不使用仿真数据的经验源自其自动驾驶技术的研发过程。2024 年 5 月 5 日,Tesla Optimus 官方发布了新的 demo 视频展示了 Optimus Gen2 的 最新进展,从视频中可以看到,Optimus Gen2 的训练数据通过人类远程 操作收集,并针对各种任务进行了扩展。这些数据通过 Xsens Link 系统 和 Xsens Metagloves by Manus 数据手套采集而来。在采集过程中穿着 Xsens Link 动作捕捉套装的工作人员会执行一系列任务,工作人员的全 身运动数据被记录下来,供机器人学习。该训练中使用了真实世界中人 类的动作数据来完成特定的任务,而没有使用合成数据,这使得机器人 的动作与感知能力更具真实性。业内消息了解到特斯拉整个数据训练团 队人员在 100+人,同时配套了 40 套+的 Xsens 高精度运动惯性全身捕捉 系统,通过海量数据收集结合视觉+触觉的端到端神经网络训练方案,让 擎天柱可以实现快速作业技能学习满足未来特斯拉超级工厂柔性作业 的需求。

Nvidia 选择远程操作+合成数据的技术路线,尤其强调仿真合成数据的 重要性。2024 年 3 月,英伟达在 GTC 大会上推出了 NIM(Nvidia Inference Microservices)云原生微服务,将过去几年开发的所有软件集成在一起, 以简化和加速 AI 应用的部署。在机器人 NIM 服务领域,英伟达推出了 MimicGen 和 Robocasa 模型,通过生成合成运动数据和模拟环境,加速 了机器人技术的研发和应用。MimicGen NIM 可根据 Apple Vision Pro 等空间计算设备记录的远程操作数据,生成合成运动数据。Robocasa NIM 可在 OpenUSD (一个用于在 3D 世界中进行开发和协作的通用框 架)中生成机器人任务和仿真就绪环境。

NVIDIA 提供了一个启用 AI 和 Omniverse 的遥操作参考工作流,使 研究人员和 AI 开发者能够从远程捕获的少量人类演示中生成大量合 成运动和感知数据。开发者使用 Apple Vision Pro 捕获少量遥操作演示, 然后在 NVIDIA Isaac Sim 中模拟这些记录,并使用 MimicGen NIM 生 成合成数据集。英伟达通过真人的遥操作数据捕获工作流整个过程,包 含三个部分:

1)数据捕捉、记录和合成:开发者佩戴 AR 设备(如 Apple Vision Pro) 进行示范操作,用户的动作被实时捕捉。这些示范动作会被记录为遥操 作数据,包括了用户的操作过程和动作细节等。然后记录的遥操作数据 被发送到 NVIDIA Omniverse 云平台中,被 NVIDIA Isaac Sim with MimicGen 用于生成合成运动数据。富士康已开始使用 NIM 和 Omniverse 来将物理工厂连接到 3D 模拟中,以此降低产线故障率并加速 生产开发。

2)数据模拟和优化:合成后的运动数据会被进一步处理,进入 NVIDIA Isaac Lab with RoboCasa 进行更深层次的模拟和测试。而处理后的合成数据和其他相关数据会被传输到 NVIDIA DGX 云平台,在这里被 Isaac Sim 和 NVIDIA Project GROOT 使用进行模拟和优化。

3)数据集成:从 NVIDIA DGX 云平台获取到的优化数据,可以控制实 际机器人进行操作。而最终的数据和操作被传输到 Jetson Thor 硬件平 台,该平台负责实际操作执行和控制。这些机器人可能用于各种实际场 景中,如厨房助手机器人等。在整个过程中,NVIDIA OSMO 服务提供 支持和协调,确保数据和操作在各个平台之间的流动和同步。这是一个 云原生的托管服务,允许用户在本地或云端协调和扩展复杂的机器人开 发工作流,大幅简化了机器人训练和模拟工作流,减少了开发周期。

智元机器人提出 G1 至 G5 具身智能技术演进路线。从 G1 到 G5 分别对 应基础自动化、通用原子技能、端到端操作技能、端到端操作大模型以 及最终的 AGI。G1 是传统自动化的起点,几乎不具备泛化能力;G2 通 过提炼可复用原子技能,并以相对通用的方式来实现,结合任务编排大 模型,可以具备对一大类相似场景的泛化;G3 开始走向数据驱动端到端, 进一步形成了一套通用的训练框架,学习一个新技能,只需要采集相应 数据就行,来实现更通用跨类别的泛化能力;随着数据量的进一步增加, G4 演变为一个通用的操作大模型,结合认知推理规划大模型,来实现端 到端通用操作;G5 是一个长期牵引目标,最终形成一个真正的感知、决 策、执行的端到端大模型。智元机器人在 G2 路线实现了通用的位姿估 计模型 UniPose、通用的抓取模型 UniGrasp,通用的力控插拔模型UniPlug 等一系列 zero-shot 和 few-shot 的通用原子技能。 在 G3 路线上,智元机器人形成了一套完整的全流程具身数据方案 AIDEA(Agibot Integrated Data-system for Embodied AI,智元具身智 能数据系统)。数采本体提供了轮式、足式等多类型、可靠稳定的机器人, 配备了一套支持全身映射、臂手协同和高精实时的遥操设备,也包括了 “数据采集-数据标注-数据管理-模型训练-模型评测-模型部署-数据回 传”等全链路的数据平台,支持 SaaS 服务和私有化部署。基于 AIDEA 的百万条真机、千万条仿真数据集将在今年四季度开源。智元还发布了 灵犀 X1-W:专业数采机器人,能降低数据获取成本,进行大规模数据 采集。

3.3. 人形机器人训练场打造如火如荼

目前还没有一个完全可以成熟部署应用的具身智能作业技术栈,国外主 要还是开展大规模数据收集与训练,探索如何构建一个可以泛化应用的 具身智能神经网络,比较典型的代表是 Google RT1 机器人训练场。

美国 HelloRobotic 构建了一个结合云端和真实机器人的训练场,机器人 即在云端开展 LLM 的训练策略,同时也采用实体机器人在真实搭建的 家居场景开展数据收集与验证测试。

由上海人形机器人制造业创新中心孵化的“开源道场“MiniGym 是目前 国内首个对标特斯拉训练的原型。由于特斯拉整体技术路线尚不清晰, 上海人形机器人创新中心团队基于开源开放的模式开源了 MiniDojo 项 目,希望能推动国内人形机器人团队与联盟共同研究其技术路线,构建 专用数据底座与具身训练体系。国家地方共建人形机器人创新中心总经 理许彬表示,他们正在打造人形机器人训练场,2024 年计划上海打造 100 个人形训练场,2027 年计划在各个城市、各个场景打造 1000 个训练场, 100 台采集设备,构建 1PB 数据集(每周生产 5TB+)。训练场构建方式: 1)搭建数据管理的平台系统,打造操作端、机器端云网服务器。2)建 设实时标定系统、控制系统、数据采集系统、数据反馈系统;3)通过数 字孪生,生成合成式数据;4)通过异构人形机器人,打造真实、生成式 数据。

北京创新中心自主研发的通用人形机器人母平台“天工”的训练基本都 是在虚拟的世界完成的。在这个虚拟世界中,数千个机器人可以同时测 试、训练,完成对自己行为的矫正。在这虚拟的物理仿真引擎中,构建 了一个非常大的训练场景。在这个仿真环境中训练 10 个小时,可能相当于在物理世界当中,一个机器人 24 小时昼夜不停地进行 100 天训练。 为了让机器人的奔跑步态更加拟人化,研究团队通过可穿戴设备,用动 作捕捉的方式进行训练,让机器人在动作处理上,更加灵活多变,姿态 也更加生动自然。

安徽省人形机器人产业创新中心和四川成都人形机器人创新中心也在 争取升级为国家级,各地的数据采集场建设如火如荼。

4. 具身智能估值基础:硬件、数据、模型、人才

2024 年 H1,全球共发生 25 起人形机器人领域融资事件,融资总额超过 10 亿美元(约合 78 亿人民币),融资额已超过 2023 年全年(27 起,超 7.15 亿美元)。2024H1 国外人形机器人融资案例:Figure AI(约 6.75 亿 美元)、1X Technologies(约 1.06 亿美元)等。 Figure AI 累计融资金额 超过 7.54 亿美元,估值 26 亿美元,1X Technologies 累计融资金额超过 1.23 亿美元。2024H1 人形机器人领域的融资主要集中在天使轮和种子 前,初创企业是融资主力军,高校教授团队创业占主导。

面的一级市场的火热,我们总结具身智能的主要估值逻辑是:硬件、模 型、数据和人才: 硬件是一切的基础。需要完全自研的高性能稳定硬件,如果没有自己的 硬件,就无法根据算法和数据进行硬件的快速优化和修改。跨硬件的算 法目前还处于论文阶段。 涉及数据的采集、组织管理以及与模型的闭环开发,需要有强大组织能 力的团队,核心团队需要具备组织大规模工程师的经验。1)主流的数据 采集方法:仿真生成数据、真实环境中采集;2)数据分发、清洗、打标 签、校验、存储、管理等:数据能力强的公司会自己做数据 pipeline,比 如 x-square,数据能力弱的会采购数据服务商的工具。 算法团队:开源算法可以提供一些基础的功能和技术,算法团队可以在 开源算法的基础上进行二次开发和创新,但是要实现高质量、高性能的 人形机器人,需要专业的算法团队进行深入的研究和开发,其重要性体 现在:1)创新性和竞争力:优秀的算法团队能够不断创新,开发出独特 的算法和技术,使人形机器人具有更好的性能、功能和竞争力。2)定制 化和优化:不同的人形机器人应用场景和用户需求可能不同,算法团队 可以根据具体情况进行定制化和优化,以满足特定的要求。3)系统集成 和协同:人形机器人是一个复杂的系统,需要各个部分的协同工作。算 法团队可以确保算法与其他硬件和软件组件的良好集成,实现系统的整 体性能优化。4)解决复杂问题:在人形机器人的开发过程中,会遇到各 种复杂的问题,如运动控制、感知理解、决策规划等。算法团队具备解 决这些问题的专业知识和经验。5)持续改进和升级:技术在不断发展, 算法团队可以持续改进和升级人形机器人的算法,使其能够适应新的需 求和挑战。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至