2025年智能驾驶技术的当下与未来:头部玩家的探索与启示

  • 来源:国盛证券
  • 发布时间:2025/05/26
  • 浏览次数:363
  • 举报
相关深度报告REPORTS

智能驾驶技术的当下与未来:头部玩家的探索与启示.pdf

智能驾驶技术的当下与未来:头部玩家的探索与启示。第一个问题:智驾能否普及?人类会不会永远不敢把生命交给智能驾驶?或者渗透率的上限很低?Eg.一个关于“电梯”发展早期的例子:从工业革命时期开始,升降机就已经可以实现上下移动物体或人的基本功能,但直到纽约在1853-1854年举办水晶宫世界博览会后,升降机才被人们视为可以每天安全使用的工具。ElishaGravesOtis在博览会上以大胆时尚的方式,推出其安全制动装置。他将平台式升降机升至10米高度,然后由其助手剪断电梯绳索。平台并没有坠到地面,他向目瞪口呆的观众鞠躬,并宣布“安然无恙!”第二个问题:...

1、软件侧:从“模仿人类”到“超越人类”、从“聋哑司机”到“司机助理”

从“模仿人类”到“超越人类”

第一个问题:智驾能否普及?人类会不会永远不敢把生命交给 智能驾驶?或者渗透率的上限很低? Eg. 一个关于“电梯” 发展早期的例子:从工业革命时期开始, 升降机就已经可以实现上下移动物体或人的基本功能,但直到纽 约在1853-1854年举办水晶宫世界博览会后,升降机才被人们视 为可以每天安全使用的工具。Elisha Graves Otis 在博览会上以 大胆时尚的方式,推出其安全制动装置。他将平台式升降机升至 10 米高度,然后由其助手剪断电梯绳索。平台并没有坠到地面, 他向目瞪口呆的观众鞠躬,并宣布“安然无恙!”

第二个问题:靠模仿人类,当智驾模型达到人类司机的优秀水平时,能否普及? A:尤其是涉及到人身安全,人性对“自己”和对“技术”的能力存在“双标”。只有远超出人类驾驶水平的 智驾技术,才能够大规模普及。

狭义的“端到端” ,是一种模仿学习思路。 通过学习 “传感器数据” 与 “人类驾驶轨迹” 的海量对照,让车端模型能做到输入传感器数据后,输出合 理的驾驶轨迹。

“超越人类”需要“强化学习”,于是世界模型被引入自动驾驶领域 。众多车企和供应商纷纷公开提出引入“世界模型”,包括特斯拉、英伟达、蔚来、理想、地平线、商汤、元 戎启行、Momenta、小鹏……

2023 年,特斯拉自动驾驶负责人Ashok Elluswamy在 CVPR 上介绍了其正在打造的 “通用世界模型”。 该模型可以通过过往的视频片段和行动提示,生成 “可能的未来” 的全新视频。其基础架构由多台摄像机 的视频流输入,汇集到一个大型 Transformer 块中,通过空间注意力和几何模型等形成特征并进行预测,可 用于预测占用率、体素未来的流动情况以及车道等驾驶所需的任务。

2024年下半年,小鹏汽车已开始面向L4级别的自动驾驶研发全新的“AI大脑” ,即小鹏世界基座模型。小 鹏研发团队利用优质自动驾驶训练数据,先后开发了多个尺寸的基座模型,目前已经着手推进72B(72 Billion,也即720亿)超大规模参数世界基座模型的研发,参数量是主流 VLA 模型 的35 倍左右。 为了开发小鹏世界基座模型,小鹏汽车打造了一座“云端模型工厂” ,工厂“车间”涵盖基座模型预训练和 后训练(强化学习训练)、模型蒸馏、车端模型预训练到部署上车的完整生产链路。

2025年1月,理想汽车自动驾驶研发副总裁朗咸朋在第四届全球自动驾驶峰会上指出:“我们的世界模型不 仅用于仿真评测,还通过强化学习框架生成合成数据,完善强化学习的闭环过程。” 2025年3月18日,理想汽车自动驾驶技术研发负责人贾鹏在NVIDIA GTC 2025分享了对于下一代自动驾驶技 术MindVLA的最新思考和进展。MindVLA基于自研的重建+生成云端统一世界模型,深度融合重建模型的三 维场景还原能力与生成模型的新视角补全,以及未见视角预测能力,构建接近真实世界的仿真环境。

2025年5月7日,李想在AI Talk第二季上分享道:“强化学习分成两个部分: 第一部分先做RLHF,带有人类反馈的。当人类会接管时,包括人类的一些习惯,来做带有人类反馈的 强化训练。安全对齐都在这个环节完成,除了遵守交通规则,还要遵守中国的驾驶习惯,开车习惯要 融入社会。 第二部分是纯粹的RL,用世界模型生成的数据来做训练。目的是开得比人类更好,中间不给人类反馈, 只给一个结果:从A点到B点开过去。有三类训练要求:1)通过G值(加速度数值)判断舒适性,给舒 适性反馈;2)做碰撞反馈,如果碰撞强化就没完成;3)交通规则反馈,如果违反交通规则就没完成。 通过舒适、交通规则和碰撞事故三个维度来做强化训练。”

从“聋哑司机”到“司机助理”

语言模型、多模态模型被引入智能驾驶领域——EMMA(谷歌旗下Waymo) 。 事实上,VLA模型最早见于机器人行业。2023年7月28日,谷歌 DeepMind推出了全球首个控制机器人的视 觉语言动作(VLA)模型RT-2。 2024年10月底,谷歌旗下自动驾驶公司Waymo推出了一个基于端到端的自动驾驶多模态模型EMMA。

语言模型、多模态模型被引入智能驾驶领域——LINGO-2(Wayve)。2024年4月17日,英国自动驾驶技术公司Wayve宣布推出闭环驾驶模型LINGO-2,可将视觉、语言和动作联 系起来,帮助解释和确定驾驶行为。LINGO-2为自动驾驶体验开辟全新的控制和定制维度,是首个在公共道 路上进行测试的视觉语言动作模型(VLAM)。

语言模型、多模态模型被引入智能驾驶领域——SENNA(华中科技大学、地平线等)。 SENNA是目前开环测试端到端智能驾驶全球第一名。数据显示,基于nuScnese数据集测得3秒钟平均L2轨迹 误差距离和3秒钟平均碰撞率都很小。

DriveVLM是在传统的自动驾驶系统上, 增加了大视觉语言模型(VLM)的能力。 由于VLM在视觉理解和推理方面的能力 突出,所以结合该大模型能力后, DriveVLM不仅具备基本的自动驾驶能 力,而且还能够理解输入的图像信息, 并作出对应驾驶决策。摄像头输入的图像序列先由视觉编 码器进行处理,生成图像tokens, 并通过自注意力机制捕捉其中的重 要特征,与VLM的组成部分大语言 模型进行对齐。 随 后 , 大 语 言 模 型 通 过 思 维 链 (chain-of-thought,CoT)进行推 理,主要包含三个模块,场景描述, 场景分析和分层规划。

场景一:一处城市开放道路,没有明显车道线,左边是对向车辆,比较拥挤;前方有一辆三轮车,路中央 还有一位交警在指挥交通。 DriveVLM识别出这位交警在指挥左边道路的交通情况,并且由于前面的三轮车正在缓慢行驶,系统作出 “缓慢直线行驶”的决策。并且解释道,这么做是因为需要和前方及两侧车辆保持安全距离,所以需要缓 慢直行。

场景二:阴雨天的城市道路,车辆准备向右前方道路行驶,但这条路上有一行人骑着电动车迎面而来。DriveVLM识别出电动自行车位于车辆前方道路右侧,结合车辆的前进方向,作出“车辆先减速,右转,并 缓慢直行”的决策。并给出说明,减速是为了等骑车的人通过,待其通过后车辆再右转。

场景三:前方道路可能发生事故,车道前方有一辆自行车倒在路上,还有交警和一位行人站在道路上。 DriveVLM判断,由于自行车阻挡了前方道路,车辆又要前行,因此要“先减速,再向右变道,并缓慢直行” 的决策。同时系统还特别解释,减速并且确保右后方没有车辆驶来时,再向右变道。

语言模型、多模态模型被引入智能驾驶领域——理想的VLA。 1)第一步训练出一个VL基座模型,也就是vision和language的基座模型。理想目前在训练的版本是一个32B参 数(320亿)的云端基座模型。 2)第二步,后训练是要把它变成VLA,把action放进来。这时模型规模会从3.2B扩大到接近4B。 3)第三步,强化训练。强化分成两个部分:第一部分先做RLHF;第二部分是纯粹的RL,用世界模型生成的数 据来做训练。 4)第四步,搭建司机agent。简单通用的短指令由端侧的VLA直接处理,复杂指令则先由云端的VL基座模型解 析,再交由VLA处理。

2、硬件侧:比人看得清、比人想得远、比人反应快

感知层:双目感知、鹰眼视觉、激光雷达,比人看得清

1)纯视觉路线的代表车企——特斯拉的双目感知

特斯拉CEO埃隆·马斯克一直坚定地反对激光雷达, 甚至多次在公开场合贬低激光雷达,比如:“激光 雷达毫无意义,对于自动驾驶汽车来说没有必要”; “激光雷达昂贵、丑陋、没有必要”;“激光雷达 就像人身上长了一堆阑尾,阑尾本身的存在基本是 无意义的,如果长了一堆的话,那就太可笑了”; “任何依赖激光雷达的公司都可能无疾而终”等。 HW4.0搭载超远距离双目摄像头,最远探测距离达 424米。 根据众安保险和中国公安部官网,驾驶员的视野范 围会随着车速提高而变窄,动态视力也会随着车速 的增加而下降。当车速是60km/h时,最大视认距离 为240m;当车速为80km/h时,视认距离为160m。 具体取决于驾驶环境、光照条件、天气状况和个人 视力等因素。

2)纯视觉路线的代表车企——小鹏的鹰眼视觉

小鹏AI鹰眼视觉方案, 感知距离提升125%,识别速度提升40%。官方介绍比人眼还要清晰10倍。 鹰眼视觉的LOFIC架构(Lateral OverFlow Integration Capacitor)和HDR功能(High Dynamic Range,高 动态范围) :LOFIC架构是一种单像素横向溢出集成电容架构,在传统的像素电容的基础上增加了一个溢出 电容,用于承接由高亮度光源产生的溢出电荷,从而提升了动态范围,在强逆光环境下也能够捕捉到清晰的 图像。 从某种程度上说,小鹏AI鹰眼视觉方案在某些方面超越了人类生物体的视觉感知能力。LOFIC方案通过摄像 头将光信号转换为电信号。当光线过强或光差过大时,人类视觉需要适应,但LOFIC方案通过特定的电容技 术处理,在车辆载体上能够很好地应对各种光差,实现精准的视觉感知。

3)激光雷达方案——主流车厂的选择

随着智驾等级的提升、激光雷达成本的下降,激光雷达迎来了大规模量产的阶段。 广汽:2024年,广汽埃安RT就已经在15万价格带实现了激光雷达上车。520激光 雷达版汇集了城市NDA、高速智驾领航和自动泊车三大功能,售价仅15.58万元; 650激光雷达版拥有同级唯一带激光雷达的超长续航高阶智驾,售价仅16.58万元。 零跑:2025年,零跑发布LEAP 3.5架构,配备300米探测距离激光雷达+5颗毫米 波雷达+12颗高精摄像头。 理想:在L系列的智驾焕新版车型上标配禾赛的激光雷达。

执行层:线控趋势已成,比人反应快

特斯拉 Cybercab 无人驾驶出租车亮相于2024年 10 月举行的特斯拉“WE, ROBOT”发布会,该车为一辆双门 轿跑,采用鸥翼门设计。马斯克表示,此次亮相的特斯拉 Robotaxi 名为 Cybercab,没有方向盘和踏板,车辆 成本预计将低于 30000 美元,并将于 2026 年投入生产。

1)线控转向

主要基于其取消了方向盘与车轮之间的机械连接,能 够凭借传感器获得方向盘的转角数据,然后通过ECU 将其计算为具体的转向数据,再结合车速及车辆行驶 状态来对车轮转角进行控制。

2)线控制动

机械式线控制动系统(简称EMB)与传统液压制 动系统相比,具有很多优势。 整个系统无制动管道连接,结构简单,体积小; 具有更高的反应灵敏度,制动距离小,动作稳 定; 由于无工作油管道和无工作油泄漏问题,维护 更加方便; 通过ECU直接控制,可以实现更多高级功能, 如ABS、TCS、ESP等,易于实现ACC等功能。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至