2024年汽车行业智能驾驶专题报告:端到端革命开启,强者愈强时代即将来临

  • 来源:信达证券
  • 发布时间:2024/09/02
  • 浏览次数:1205
  • 举报
相关深度报告REPORTS

汽车行业智能驾驶专题报告:端到端革命开启,强者愈强时代即将来临.pdf

汽车行业智能驾驶专题报告:端到端革命开启,强者愈强时代即将来临。 智能化时代,自动驾驶能力将重新构筑车企竞争壁垒,核心竞争要素在于“数据”+“算力”。背后原因在于:①对消费者而言,智能化在消费者选购汽车中的重要性正日益提升。②对于车企而言,实现高阶智驾需要大量投入,中小车企将难以持续投入。③特别是当智能驾驶算法层面逐渐收敛至“端到端”架构后,数据+算力将成为核心竞争要素,头部车企或供应商能掌握更多更优的“数据”,以及更强更快的“算力”,而优秀的智驾能力有望加强销量转...

1. 总论:端到端有望引领新一轮智能驾驶产业革命

1.1 电动智能时代,车企竞争壁垒发生重大迁移

燃油车时代,车企壁垒在于自研三大件(发动机+变速箱+底盘),由于机械结构复杂且外资车 企经过百年积淀,技术及专利储备雄厚,自主品牌较难逾越技术壁垒,更难以实现品牌跃升, 因此燃油车造车门槛高、参与者相对较少、市场份额为外资/合资品牌把控。 电动化时代,汽车结构大幅简化,且电动车核心三电(电池+电机+电控)均有成熟供应商方案 可供采购,因此在电动化初期,造车门槛大幅下降,行业进入百家争鸣时代。 智能化时代,我们认为自动驾驶能力将重新构筑车企竞争壁垒。核心原因如下:①智能化在消 费者选购汽车中的重要性日益提升。②实现高阶智驾需要在数据、算力层面的大量投入,中小 车企或难以承受。③当算法层面逐渐收敛至“端到端”,数据+算力将成为核心竞争要素,有望 “强者愈强”。

1.2 自动驾驶能力将构筑车企新壁垒,核心竞争要素包括数据+算法+算力

自动驾驶与 AI 应用类似,算法、算力和数据是三大核心竞争要素。我们认为把握数据、算力、 算法三大核心竞争要素的车企有望率先取得智驾层面的领先优势。

数据:AI 驱动数据闭环逐渐形成,数据体量、质量要求日益提升。自动驾驶概念中的数据主要 包括视觉传感器采集的数据,以及车辆状态信息、油门、刹车等数据,经过各类元件与电路处 理后得到有用的电信号,最后用于云端存储、数据标注、模型训练、仿真测试等环节。在端到 端等人工智能技术加持下,数据筛选、标注、训练、验证逐渐形成全链路闭环,加速智能驾驶 解决方案迭代。随着技术迭代,对于智驾数据体量、质量的需求也在持续提升,目前以特斯拉、 鸿蒙智行等为代表的各家车企开始使用智能驾驶累计使用里程来反映各自在自动驾驶领域的数据收集与测试能力。

算力:端到端模型更加依赖规模法则(Scaling Law),新一轮算力军备竞赛在车端与云端共 同展开。Scaling Law 认为通过更多数据量训练、扩大模型规模以及延长训练时间,大模型性 能可以持续提升,端到端模型与大模型高度相似,数据驱动的开发形式让模型高度依赖算力规 模来提升迭代速率。车端算力主要的特点是低延迟、高可靠性,当前主流方案为单/双 Nvidia Orin X 芯片,算力为 254/508TOPS;下一代 Thor 芯片算力或提升至 2000TOPS,近日联想已 发布基于 Thor 的域控解决方案,更高车端算力平台的落地进程有望逐步加快。云端算力需要 承担复杂的训练任务和海量的数据处理,对功耗和成本的要求相对车端宽松,但算力更高,目 前众多车企通过自建算力中心或购买智能计算云服务来实现云端算力布局。 算法:算法从规则走向神经网络,从模块化走向端到端。自动驾驶诞生以来,伴随着算法架构 的不断进化,自动驾驶算法也几经迭代。2021 年开始,特斯拉展示了基于 BEV+Transformer 的自动驾驶感知新范式,国内众多车企也纷纷跟进,进一步加速了城市 NOA 落地进程。2023 年 12 月特斯拉发布 FSD Beta V12 引入端到端概念之后,众多车企和智驾公司也开始转向端 到端技术的研发和量产工作,以大量人类驾驶数据+深度神经网络为基础,未来智能驾驶体验 逐步向着更加拟人化的方向迈进。

总体而言,我们认为从基于规则逐步转向基于神经网络,从小规模、模块化的算法走向基于大 规模神经网络、端到端的自动驾驶算法架构为未来智能驾驶算法主要的发展路径。在算法演进 路径逐步收敛之后,工程化落地能力或将逐步成为车企智能驾驶软实力的重要组成部分。

2. 什么是“端到端”?

2.1 数据、算力+底层 AI 技术的进一步发展有望助力端到端快速发展与普及

端到端概念最早源于通信领域。其基本含义是网络只负责为终端之间提供连接,无论终端之间 的连接距离、连接机器数量、连接系统与路线是怎样的,两端之间一定要建立联系,连接建立 后即表示端到端的连接已完成。 底层 AI 技术的逐渐成熟,有望带来自动驾驶技术新一轮发展与普及。在人工智能领域,基于 深度神经网络的端到端是普遍使用的方法。深度学习具有出色的模式识别和特征提取能力,主 要用于图像分类、目标检测、人脸识别、图像分割、视频分析等场景。在各种 AI 翻译、语音转 文字等 AI 应用中,基本都使用了端到端的思想,原始数据被送进一张神经网络中,经过一系列 运算后给出最终结果。除了以上场景,我们认为智能驾驶也是 AI 技术中重要的应用场景,并 且出于安全性、稳定性等要求,在底层 AI 技术逐渐趋于成熟之时,端到端赋能的自动驾驶技 术有望新一轮发展与普及。 2023 年以来,端到端在自动驾驶学界与产业界的热度快速提升。学术研究方面,2023 年 6 月, 上海人工智能实验室提出的 UniAD (Unified Autonomous Driving)获 CVPR 2023 最佳论文, 行业对于端到端的关注度开始提升。产业落地方面,特斯拉 FSD(Full Self Driving)V12 全面 升级端到端技术架构,国内以鸿蒙智行、小鹏汽车、理想汽车为代表的主机厂以及华为、元戎 启行、商汤绝影、百度等为代表的智能驾驶技术公司纷纷投入端到端系统研发,量产上车规划 也陆续对外披露。

2.2 深度神经网络驱动端到端实现“数据驱动”,取代传统“规则驱动”算法

传统的自动驾驶架构可以理解为分模块架构,包含感知(Perception)、定位(Localization)、 预测(Prediction)、决策与规划(Decision and Planning)、控制(Control)等。感知端 输入摄像头、激光雷达等传感器信息,能够感知到车辆周围的障碍物、车辆、车道线、红绿灯 等元素;然后感知信息会进一步汇总传递给规划模型,规划模型规划出车辆最佳行驶路线;再 交给控制模块,实现车辆最终的控制。

传统的模块化架构将自动驾驶分为多个子模块,具有较高的稳定性与可解释性。传统自动驾驶 架构各模块有独立的算法,例如目前市面上大部分智驾系统中的感知模块使用的是神经网络, 处于下游的规划模型需要依赖工程师编写大量代码去制定行驶规则。这种架构的优势在于独立 开发利于分工,出现问题时便于分模块检查与解决,具有较高的稳定性与可解释性。 分模块的局限性在于:首先,基于人为制定规则的方式无法穷尽所有的道路状况,特别是极端 状况(corner case)下,会提升决策规划控制的难度。其次,分模块方案的信息流转的层级 较多、传递的链路较长,所以信息失真情况会更严重,各模块之间传递的信息会出现有损压缩, 传递时会累计误差,还会面临并行模块信息相互干扰的问题。

与传统自动驾驶算法结构相比,端到端定义尚未统一,其主要特点在于深度学习的全面使用与 数据驱动。 深度学习是一种机器学习方法,其目标是通过构建多层神经网络来模拟人脑的工作原理,让机 器能够从大量的数据中自动学习和提取特征,从而实现智能化的数据处理和决策。神经网络是 深度学习的核心组成部分,深度学习采用多层神经网络模型,其中包含输入层、多个隐藏层和 输出层。 输入层:负责接收原始数据(如视频、图像等),并将其转化为可以被隐藏层处理的格式。 隐藏层:主要是对输入数据应用一组权重和偏差,从输入数据中提取对当前任务更有意义的高 级特征,根据任务复杂程度,可以选择单层或者多层隐藏层。 输出层:输出隐藏层的处理结果。

神经网络的主要训练过程包括前向传播与反向传播,可以在训练过程中实现自行学习与改进。 前向传播是将输入数据通过神经网络生成输出的过程。它涉及计算网络每一层中每个神经元的 输出,通过将权重和偏差应用于输入并通过激活函数传递结果来完成。反向传播通过计算损失 函数的梯度,反向传播允许神经网络以减小训练过程中的整体误差或损失的方式更新其权重。 深度神经网络的训练过程表明其可以直接从数据中学习特征,并自行学习和改进,在自动驾驶 算法中可以去掉人工编写的规则,实现数据驱动。神经网络更适合处理大型数据集,与传统机 器学习需要手动提供特征不同,我们可以直接向算法投喂高水平人类司机真实的驾驶视频数据, 通过反复训练使算法理解并学习高水平司机的驾驶习惯,输出正确的行驶轨迹,从真实数据中 学习如何开车,最终实现数据驱动。 综上所述,通过神经网络实现的端到端自动驾驶优势包括:①完全基于数据驱动进行全局任务 优化,具备更好、更快的纠错能力;②传统分模块的架构被进一步压缩,能进一步减少模块间 信息的有损传递、延迟和冗余,避免误差累积,提升计算效率;③泛化能力更强,由 Rule-based 算法转向 Learning-based,具备零样本学习能力,面对未知场景仍可正确决策,智能驾驶的上 限会比传统架构更高。

2.3 目前的“端到端”自动驾驶包含狭义与广义两种定义

目前端到端自动驾驶的定义可以简单分为狭义端到端和广义端到端。狭义端到端:传感器数据 进入神经网络处理后,直接输出方向盘、油门、刹车等执行器的控制信号,该模式通过单一神 经网络模型实现,是严格意义上的端到端。

广义端到端:广义上的端到端具有两个特点①信息无损传递;②可以实现数据驱动的整体优化。 从广义角度理解端到端,可以看到目前主流的方案仍有差异。主要方案包括通过神经网络模型 实现感知与决策规划,不包括控制模块;感知和决策规划使用神经网络,模块之间仍有人工设 计的数据接口等方式。

2.4 端到端迭代有望实现从“感知”到“决策”到“One Model”平滑过渡

从端到端的最终实现上,我们认为通过①感知“端到端”,②模块化“端到端”,再到③One Model/单一模型“端到端”是一种相对平滑的过渡形式。而当前感知“端到端”已经是主流的 感知模型,展望后续技术发展,我们认为自动驾驶算法向“端到端”收敛,有望成为行业的一 大趋势。 不同迭代阶段之间的区别: 感知“端到端”:当前的主流感知算法路线大多数都是用神经网络模型,通过基于多传感器融 合的 BEV(Bird Eye View,鸟瞰图视角)+Transformer 基本实现了感知模块的端到端,感知输出 检测结果的精度及稳定性相对之前的感知方案都有比较大的提升,但在决策规划控制模块仍然 以 rule-based 为主1。 模块化“端到端”:与感知“端到端”相比,感知端算法没有太大变化,决策规划控制模块有 望通过深度学习实现,取代原有的 rule-based 方案,从这一阶段开始,端到端的雏形逐渐形成。 并且感知与决策规划控制模块之间的数据传递有望由人为定义的结果抽象为特征向量,避免数 据损耗与误差累计等问题,决策规划控制模块的综合模型基于特征向量输出运动规划的结果2。 One Model/单一模型“端到端”:这一阶段不再有感知、决策规划等模块的明确划分。从原始 信号输入到最终规划轨迹的输出直接采用单一深度神经网络实现。One Model 可以基于强化学 习(Reinforcement Learning, RL)或模仿学习(Imitation Learning, IL)的端到端模型,也可 以通过世界模型这类生成式模型衍生3。

3. 数据、算力、算法既是端到端落地驱动力,也是落地挑战

3.1 数据挑战:获取成本和难度较高,特斯拉目前处于领先

端到端自动驾驶及用途神经网络实现数据驱动,因此用于训练的数据要求越来越高。端到端对 训练数据的要求主要体现在数据量、数据标注、数据质量和数据分布等方面4。

分车企看,特斯拉在数据规模层面处于领先地位。与大语言模型可以在互联网上爬取海量文字 数据用于训练不同,端到端智驾需要的视频数据获取成本和难度较高。对于车企而言,我们认 为决定自动驾驶训练数据的重要因素包括目前能够稳定收集数据的车辆总数、以及车企智驾车 型比例,这与车企自研实力、综合产品力、资金投入、智驾车型销量息息相关。 根据车企公布的数据,截至 2023 年年初,特斯拉 FSD 在北美的累计测试车辆数在 40 万辆左右,到今年 3 月,已经达到 180 万辆。据华为预计,截至 2024 年底,搭载华为智驾系统车型 保有量将突破 50 万台。截至 2024 年 7 月份,理想累计交付超过 87 万辆,其中有 99%的用户 使用过辅助驾驶。截止 2024 年 7 月份,蔚来智能驾驶总用户数达 55.8 万人,NOP+总用户数 达 30.8 万人。2024 年上半年,小鹏 XNGP 的智能导航辅助驾驶的用户渗透率达到了 95.87%。

对于智驾供应商而言,数据获取难度会更大。此前国内上海 AI lab 浦驾团队搜罗了整个 Youtube, 才最终搭建了一个 2000 小时的数据集 OpenDV-2K。在 2023 年特斯拉端到端神经网络开发之 初,就投喂了 1000 万个经过筛选的人类驾驶视频片段,即使以每段 15 秒计,这也是超过 4 万 小时的高清视频。

3.2 算力挑战:算力竞争重点由车端转向云端,算力需求水涨船高

端到端与 ChatGPT 等生成式大语言模型类似,除了海量高质量数据之外,还需要强大的算力 来支撑模型的训练。过去几年,以英伟达、地平线、Mobileye 等为代表的车端算力芯片受到行 业高度关注。随着汽车智能化的竞争重点从算法转向数据和算力,云端算力或将成为车企未来 几年竞争的关键。 算力即计算的能力,狭义定义是一台计算机理论上具备的最大每秒浮点运算次数(FLOPS)。 广义定义是计算机设备或计算/数据中心处理信息的能力,是计算机硬件和软件配合共同执行某 种计算需求的能力。除了运算能力之外,还包括数据存储与访问能力、与外界的数据交换能力、 数据显示能力等。 算力的基础是各类高性能计算芯片。计算芯片主要包括 CPU(中央处理器)和 GPU(图形处 理器)。CPU 是计算设备的运算和控制核心,适合处理逻辑复杂的串行任务。GPU 早期主要 用来加速图像计算任务,由于其更加侧重计算而非逻辑控制,并能很好地支持并行计算,成为 目前提供算力的主要芯片。因此目前大算力 GPU(英伟达 H100、H800、A100、A800 等)的 储备情况往往成为衡量训练算力资源的重要依据。

国内、厂商与特斯拉超算中心的算力水平差距较大,另外还有 GPU 采购的难题。大部分研发 端到端自动驾驶的公司目前的训练算力规模在千卡级别,国内算力布局领先的车企与供应商包 括商汤、华为、理想、小鹏等。特斯拉近年来不断增加训练算力投入,2024Q1 财报电话会上 特斯拉表示,公司已经有 35000 张 H100GPU,并计划在 2024 年内增加到 85000 张 H100 以 上,届时总算力有望达到 100EFLOPS。此前,特斯拉还部署了规模更大的 A100GPU 训练集 群,其实际训练算力投入在自动驾驶行业中大幅领先其他参与者5。 我们认为当算法层面逐渐收敛至“端到端”,数据+算力将成为核心竞争要素,以特斯拉、华 为、理想为代表的智能驾驶与整车交付领先以及算力储备领先企业有望“强者愈强”。

车端算力或并非端到端落地的主要矛盾。首先,目前以英伟达 Orin 为代表的大算力车载芯片 已经支持 BEV+Transformer 模型的部署,并且架构从传统模块化到端到端后,总代码数量会 显著降低,因此端到端带来的车端算力需求相比 BEV 模型并不一定会有显著的提升,更多的 需求可能来自模型参数量和模型性能的提升。其次,高算力芯片与算法一直处于动态演化的过 程中,相比于对更大算力的需求,基于现有算力芯片优化端到端模型实现更高效部署可能是更 容易实现的方案。目前行业头部竞争者如英伟达、华为、地平线、蔚来、Momenta 都在逐渐走 向软硬一体,针对自研模型定制化开发更匹配的计算芯片,可以做到最大程度的优化6。

3.3 算法挑战:黑盒算法局限性、验证测试与世界模型

3.3.1 黑盒算法局限性:不可解释性、灾难性遗忘等问题易造成端到端算法上限高、下限低

端到端的“黑盒”属性导致其具有不可解释性。可解释性在自动驾驶中很重要,它有利于工程 测试和系统改进,还能从社会角度提供性能安全保证,增加民众对自动驾驶的接受度。但神经 网络的先天缺点是不可解释性,也叫“黑盒”属性。通俗理解就是向神经网络输入数据并得出 正确的计算结果,但我们并不知道结果是如何计算出来的。神经网络的“黑盒”属性会对智驾 的安全性带来影响。根据 Li Chen 等发表的论文《End-to-end Autonomous Driving: Challenges and Frontiers》,可以通过多种方式增强模型设计的可解释性。

在已公布的解决方案中,华为和小鹏采用了模块化端到端的渐进式路线:模块间有人类定义的 接口,便于人类解读中间结果,并检查、定位问题,并且串联两个较小的模型可以使得训练难 度更低、消耗算力更小,落地时间更快。

理想通过并联一个 22 亿参数规模的 VLM(Vision-Language Model,视觉语言模型)大模型 解决可解释性差的问题:VLM 模型对复杂交通场景、交通文字标识有更强的理解力,能够为端 到端模型的驾驶决策提供参考,提升智驾系统的表现。

端到端算法还存在灾难性遗忘的问题。灾难性遗忘是神经网络固有的局限性,主要是指系统在 引入新数据时突然忘记以前学到的信息。主要原因是训练期间引入新任务,神经网络调整其参 数或权重以适应新任务,导致覆盖从之前任务中获得的知识。日前马斯克在推特上解释了 FSD V12.4.2 推迟的原因,该版本投喂了大量需要接管的复杂场景数据进行训练优化,但在简单场 景的驾驶平顺性反而倒退了。针对这种情况,需要对神经网络采取一些权重固化措施后重新训 练。

3.3.2 验证测试:端到端验证测试尚不成熟

经典的自动驾驶架构验证环节已较为成熟。感知算法使用回灌数据进行离线开环测试,规控算法基于模拟器进行闭环测试验证7。端到端自动驾驶系统测试有两种方法:①仿真环境中的在线 /闭环测试;②人类驾驶数据集的离线/开环测试。 在线/闭环测试需要构建一个模仿真实驾驶环境的模拟环境,在模拟环境中部署测试系统并测 试端到端性能,目的是缩小算法训练与实际应用之间的差距。此类测试一般涉及三个主要子任 务:参数初始化、交通仿真和传感器仿真。在线/闭环评估的优点在于可以对初始环境参数、交 通状况、传感器数据等实现高度控制,缺点包括①大多数数据样本是常见驾驶场景,而长尾场 景和异常驾驶场景数据几乎无法获取;②数据自动标注方法需要更加准确高效;③为解决城市 某些场景下性能不佳的问题,需要提升场景数据挖掘和场景理解能力。(资料来源:Li Chen 等 《End-to-end Autonomous Driving: Challenges and Frontiers》,Lincan Li 等《Data-Centric Evolution in Autonomous Driving: A Comprehensive Survey of BigData System, Data Mining, and Closed-Loop Technologies》) 离线/开环测试根据预先记录的人类驾驶行为来评估系统的性能,通过将系统预测的未来轨迹 与人类驾驶数据中的轨迹进行比较来衡量性能。目前主流的离线数据集包括 nuScenes、 Argoverse、Waymo 和 nuPlan,所有这些数据集都包含来自现实世界驾驶环境的大量带注释 的轨迹。开环评估的优点是基于真实的交通和传感器数据,测试易于实现。缺点包括①静态数 据集中学习的行为可能无法转化为现实世界驾驶场景的动态特性;②测试过程驾驶系统可能会 偏离人类的驾驶数据,因此必须验证系统从这种偏离中恢复的能力。

3.3.3 世界模型:重建真实世界的重要工具,亦存在端到端算法的问题

世界模型的概念是指能够学习及揭示真实世界物理及数学定律的模型8,具备对信息的全景理解力,在想象的维度理解物理规律,并重建世界。简单来说,就是通过构建人类大脑的复杂认 知过程,模拟人类感知和决策过程,为自动驾驶系统提供预测和适应动态环境的能力。 通过世界模型重构世界,智能驾驶算法的空间理解能力有了进一步升级。智能驾驶的感知算法 经历了 2D/3D 检测-BEV 算法-占用网络 OCC 算法的迭代。2020 年之前感知算法只能进行 2D/3D 检测,即分辨特定对象、确认三维空间位置,并提取车道线。2022 年,智能驾驶感知算 法普遍升级到 BEV 算法,将所有摄像头的信息聚合到一个环境中,通过一张鸟瞰图俯瞰周边, 动态感知更精准。但是,BEV 算法的框架还是基于二维,缺乏高度信息导致无法感知异形物体。 2023 年开始,行业开始引入占用网络 OCC 算法,对环境的感知升级为三维。但 OCC 的感知, 缺失表面材质信息,对细小物体等不确定性的描述不足。 世界模型在智能驾驶场景中的主要能力在于:①还原真实的物理世界,以及动态物体和静态物 体之间的关系,符合大家对于真实场景的认知;②场景更加丰富,视频生成软件给出的视频只 有简单的一个运镜,场景相对简单,世界模型可以生成丰富度更高的视频场景;③能在短时间 内推演出多种可能发生的轨迹并寻找最佳决策,得到驾驶的最优解。基于世界模型,智驾模型 在感知端的时空理解能力、环境想象的真实度与丰富度会有明显提升,并且进一步具备了路径 规划与最佳路径选择能力。

在端到端概念中,世界模型具有两个作用:①根据外部输入生成视频,可以作为端到端模型训 练的数据源:通过世界模型生成的数据可以覆盖大量极端工况(如车祸或长尾的障碍物等), 并且在线生成的数据具有成本优势。②对世界模型进行微小的调整或者增加一些输出链路及模 块,就可以实现 One Model 端到端自动驾驶:世界模型本身具备理解周围环境以及预测交通 参与者行为的能力,同时也具备推理和理解的能力基础,所以它有能力基于所有已掌握信息进 行推理和最佳决策及规划。因此只要对世界模型进行微小的调整或者增加一些输出链路及模块, 就可以很快实现端到端自动驾驶。但同时因为世界模型基于端到端概念,其也具有黑盒算法带 来的不可解释性等问题9。

4. 特斯拉引领端到端智驾算法迭代,国内参与者多点开花

4.1 端到端主要参与者包括主机厂、自动驾驶公司与人工智能公司等

端到端主要参与者涵盖了车企、人工智能企业、自动驾驶技术公司机器人公司以及自动驾驶芯 片制造商。主机厂包括特斯拉、小鹏、理想、蔚来等,主要供应商包括华为、元戎启行、商汤 绝影、百度等公司。从技术路线看,主流路线包括小鹏、华为的模块化端到端,商汤绝影的一 体化端到端,另外还包括理想的双系统端到端,以及蔚来基于世界模型的端到端。

4.2 特斯拉 FSD V12 落地引领端到端变革

特斯拉经历了自研芯片、算法结构、数据标注与融合等方面的升级,逐步向端到端迈进。 硬件层面,特斯拉经历多次迭代升级至 HW4.0,其中传感器硬件通过 7 颗摄像头实现纯视觉路 线;智驾芯片从 HW3.0 开始实现自研,HW4.0 进一步升级,算力达到 720TOPS。

算法结构层面,特斯拉最初与 Mobileye 进行合作,从 2016 年开始自研。2020 年开始实现 BEV+Transformer+占用网络升级,逐步转向大模型时代。2023 年 12 月,FSD V12 测试版亮 相,将城市街道驾驶堆栈升级为经过数百万视频剪辑训练的单一端到端神经网络,取代了超过30 万行显式 C++代码。

自动驾驶软件版本迭代方面,2013 年特斯拉开始 Autopilot 研发,主要功能包括主动巡航控制、 自动辅助转向等;2020 年开始 FSD Beta 开启内测,2023 年 12 月,FSD V12 测试版升级单 一端到端神经网络,2024 年 3 月 FSD Beta 更名为 FSD Supervised(有监督的自动驾驶), 在性能、安全、法规遵从方面持续突破,落地进程有望加速。

特斯拉围绕数据驱动实现了自动驾驶的快速迭代,FSD 有望持续进化。从 Autopilot 到端到端 架构,特斯拉通过影子模式、HydraNet 神经网络架构构建、数据自动标注、算法层面迭代 (BEV+Transformer+占用网络等)、算力储备等布局实现了逐步迭代升级。

从实际体验来看,端到端的 FSD 开起来更加拟人、丝滑。何小鹏在加州体验 FSD 最新版本时 表示,FSD 比他作为加州新手司机开得更好。根据实测视频,面对复杂的施工路段、夜晚临时 路桩、飞扬的纸袋、路过的动物等,特斯拉 FSD 均能做出灵活且准确的反应。根据 Tesla FSD Tracker 统计,FSD V12.3 在城市工况下平均接管里程为 20 英里,平均安全接管里程为 372 英里。 特斯拉或将通过世界模型实现 3D 空间生成。特斯拉 AI 负责人 Ashok Elluswamy 表示特斯拉 正在试图构建一个更加通用的世界模型(General World Model),它能够预测未来并帮助神经 网络自主学习,能够以 AI 的方式生成 3D 空间,并且根据人类的左右转弯等指令,在八个摄像头视角里同时进行一致性非常强的 3D 变换。 特斯拉 FSD 入华限制逐渐解除,与百度地图达成合作。4 月底马斯克抵京当日,特斯拉通过中 国汽车数据安全 4 项全部要求——车外人脸信息等匿名化处理、默认不收集座舱数据、座舱数 据车内处理、处理个人信息显著告知,我们认为在数据层面的限制正逐步解除。4 月 22 日,百 度副总裁尚国斌官宣与特斯拉达成合作,称百度地图真车道级导航将在特斯拉全球首发。7 月 初,特斯拉 Model Y 后轮驱动版进入江苏省政府新能源用车采购目录,上海临港新片区国企也 已采购一批特斯拉 Model Y,各地已陆续解除对特斯拉等智能网联汽车的禁行禁停限制。

在二季度财报电话会议上,马斯克表示特斯拉 FSD 有望在 V12.5 或者 12.6 版本,进入中国、 欧洲,以及其他国家,并在早期推送之后提交给上述国家的监管部门进行审核。马斯克表示 FSD V12.5 的参数量是 V12.4 的五倍,可以实现高速道路和一般道路相统一的高阶智驾解决方案, 按照当前的迭代节奏,我们认为 V12.6 有望在年内推出。根据特斯拉财报,截止二季度末特斯 拉 FSD 累计测试里程已突破 16 亿英里,其中 FSD V12 测试里程已突破 6 亿英里。马斯克表 示他们计划在年内达成一个重要里程碑,即在实际行驶超过十亿英里的过程中,受监管的自动 驾驶系统将比人类驾驶员更为安全。

4.3 华为、小鹏、理想等车企与供应商纷纷跟进,技术路线有望向“端到端”收敛

4.3.1 华为 ADS3.0 享界 S9 首发,构建感知、规划控制神经网络实现模块化端到端

华为在 2024 年 4 月推出了新品牌乾崑及其新一代智能驾驶解决方案 ADS 3.0,该方案以 GOD 网络和 PDP 网络为核心,实现端到端的智能驾驶。华为 ADS 3.0 8 月份率先搭载享界 S9 交 付,9 月开始有望依次推送鸿蒙智行其他车型以及 Hi 合作模式车型。

在 ADS 2.0 智驾解决方案中,华为在 BEV 的基础上增加了 GOD+RCR 网络实现“全国都能 开”的无图 NCA 智驾能力。GOD 网络(General Obstacle Detection,通用障碍物检测网络) 可以通过激光雷达+摄像头,来识别通用障碍物白名单外的异形物体,用 3D 像素块来构建出障 碍物的轮廓,对路上的障碍物进行精细识别,障碍物的识别不再存在上限。 RCR 网络(Road Cognition & Reasoning,道路拓扑推理网络)进一步让智驾摆脱高精地图 的依赖,结合普通导航地图来与现实进行匹配和印证,再实时通过传感器来拓扑绘制一幅可用 的行车地图,能够做到具体路况具体分析。

ADS 3.0 升级点主要在于构建了 GOD 感知神经网络+PDP 决策神经网络实现模块化端到端。 在 ADS 3.0 当中,华为将 GOD 和 RCR 都神经网络化,并纳入到一个完整的 GOD 感知神经 网络,规划决策模块构建了 PDP 决策神经网络,实现去 BEV 化。华为还利用自己的云端 AI 训 练平台进行大量的数据训练,让模型得以快速迭代升级。截止目前,华为学习训练的算力已经 从 3.5E FLOPS 更新到 5E FLOPS,模型每天训练的里程数达到了 3500 万公里。 华为还在端到端模型中增加了“本能安全网络”进行下限兜底,增强模型可解释性与稳健性, 避免端到端下限低的问题。

ADS 3.0 升级后体验亮点包括:①享界 S9 泊车代驾正式商用,到达目的地后,人可下车即走, 车辆自主泊入,解决停车找位难、费时间等痛点;②开启条件不挑场景,可以从地库车位、路 边临时停车等等状态下直接起步;③可以自己过闸机、下地库、自主泊车的几个功能无缝衔接, 可实现车位到车位的智驾体验;④特殊场景应对:鬼探头,ADS 3.0 能够及时避让或刹停;对 向来车时会主动博弈避让。

4.3.2 小鹏:组织架构调整,全面投入端到端

小鹏 5 月发布 AI 天玑系统,成为首个落地量产端到端大模型的车企。AI 天玑系统是一个将 AI 技术全面应用于智能座舱与智能驾驶的操作系统,核心功能包括 AI 小 P(升级了 LLM 的 AI 助 理)、AI 司机(包括 AI 代驾、AI 泊车、XNGP 等智能驾驶功能)、AI 保镖(车辆环境的大范 围感知及预警)。此次升级 XNGP 升级了模块化端到端模型,主要由 XNet 感知神经网络、 XPlanner 规划控制大模型以及 XBrain 大语言模型组成。 感知大模型 XNet:聚合动态 XNet、静态 XNet、纯视觉 2K 占用网络,能够让自动驾驶系统对 现实世界中的可通行空间进行 3D 还原,清晰识别静态障碍物细节,感知范围提升 2 倍,面积 有 1.8 个足球场大小,能精准识别 50+个目标物。 大语言模型 XBrain:通过大语言模型网络,提高自动驾驶对复杂甚至未知场景的泛化处理能 力,及对宏观逻辑的推理能力,从而做出兼顾安全及性能的拟人驾驶决策。能够认识待转区、 潮汐车道、特殊车道、路牌文字,理解各种令行禁止、快慢缓急的行为指令。 规控大模型 XPlanner:基于图像数据的感知输入,实现对智驾行驶路径的规划控制。规划大 模型基于数据驱动模式迭代,取代人类手写规则代码,使得驾驶策略向拟人进化,目前在效果 上,前后顿挫减少 50%、违停卡死减少 40%、安全接管减少 60%。

XNGP 于 7 月底升级“全国都好用”,年内实现“门到门”智驾体验。7 月 30 日,小鹏宣布 AI 天玑系统 XOS 5.2.0 版本向全球推送,坚持“每 2 天一次版本迭代,每 2 周一次体验升级”, 在 5 月首次发布后至迭代版本超 35 个。XNGP 最新一轮 OTA 内测中 AI 代驾已实现自动过 ETC,按照规划 2024 年四季度打通全国道路,打通行泊场景,AI 代驾实现车位到车位体验。 按计划,2025 年小鹏现有车型都将开始进行 AI 天玑系统公测,在中国实现类 L4 级智驾体验, 并且目前正在全球范围对 XNGP 端到端的能力进行测试,智驾技术开始走向全球。

在组织架构层面,小鹏自动驾驶部门新设三大 AI 板块,全面推进端到端研发。小鹏自动驾驶 部门新设 AI 模型开发、AI 应用开发、AI 效能开发三大板块,其中 AI 模型开发部门主要负责端 到端模型开发。相较原来由产品研发部、架构、系统开发部等 10 多个部门组成,调整后智驾 团队研发方向更加“精简”,专注于端到端研发。 在投入方面,2024 年,小鹏汽车在研发上将投入 70 亿元。何小鹏透露目前公司已有 7000+张 GPU 卡,小鹏今年将在训练算力上再投入超过 7 亿元。

4.3.3 理想:构建端到端+VLM(视觉语言模型)双系统,进一步提升端到端下限

理想端到端采用了“行业首个双系统量产方案”,双系统包含系统 1:端到端模型,系统 2 : VLM(视觉语言模型)。 系统 1 由一体化端到端实现,具备高效、快速响应能力,能够应对驾驶车辆时 95%的常规场 景。系统 2 是与系统 1 相并联的一个 22 亿参数规模的 VLM(视觉语言模型),具备复杂环境 理解能力、修正导航的能力以及理解交通规则与文字标识的能力,主要应对系统 1 处理不了的 复杂情况,约占日常驾驶场景的 5%。

VLM 本质是一个多模态大模型,可以利用大语言模型的认知能力理解场景,输出另外一条行 驶轨迹给端到端模型参考修正。因为端到端模型的是黑盒算法,对于目标的错检漏检,以及幻 觉问题难以通过直接调参解决,所以理想通过 VLM 以及适当的强化学习手段来规范端到端模 型的行为。

除了双系统之外,理想还在云端部署了重建+生成式世界模型。该模型基于重建和生成两种技 术路径,将真实数据通过 3DGS(3D 高斯溅射)技术进行重建,并使用生成模型补充新视角。 重建+生成的场景为自动驾驶系统能力的学习和测试创造了更优秀的虚拟环境,使系统具备了 高效闭环的迭代能力,保证了系统的安全、可靠、高效。

根据理想汽车规划,双系统方案将于 8 月开启千人公测,官方预计今年底或明年初面向普通用 户推送。7 月份向全量 AD Max 用户推送的无图 NOA 仍然基于分段式端到端实现。

4.3.4 蔚来:构建基于世界模型的端到端算法,时空理解+规划决策能力全面提升

基于对于时空理解能力需求的提升,蔚来构建世界模型实现端到端。单一端到端模型对于时间 维度信息的融合和推演都是定长的,缺乏自动建模长时序信息的能力。在蔚来科技日上,蔚来 智能驾驶副总裁任少卿发布了蔚来世界模型 NWM(NIO World Model)。NWM 类比人脑具有想 象推演和想象重建能力,可以根据一个真实场景,生成一万个“平行世界”。其表示该模型和 端到端架构结合,能够进一步提升算法对复杂场景的处理能力,补足了自动驾驶系统预测未来 事件以及时空理解与想象能力。

NWM 主要的优化在于①全量理解信息,空间认知能力更强;②能够预测接下来的场景;③生 成式无监督的方式,对海量数据的利用更加高效,基于以上能力,MWN 理解世界、推演世界、 仿真世界的能力。 1、理解世界:通过自回归的方式重建原始传感器信息的输入,在其中自动学习知识和物理规 律,能够做到全量信息重建,想象重构世界,保证更强的泛化能力。 2、推演世界:NWM 能在 0.1 秒内推演出 216 种可能发生的轨迹,并根据外界的信息的输入, 重复更新内在时空的模型,对 216 种可能性进行预测,得到驾驶决策最优解。 3、仿真世界:NWM 具备闭环仿真测试能力,生成式仿真模型 NSim 可以在真实世界唯一轨迹 的基础上增加大量 NWM 推演的轨迹与仿真结果进行对比,让输出的智驾轨迹和体验更安全合 理高效。 世界模型的端到端架构将在全新智能驾驶架构 NADArch 2.0 上车。蔚来智能驾驶架构 NADArch 2.0 在算法层面升级为引入世界模型的端到端架构,全域领航辅助 NOP+和智能安全 将同步升级为 2.0 版本。其中,点到点全域领航辅助 2.0 将于下半年上车,智能安全 2.0 已逐 步迭代。端到端技术将首先应用在主动安全功能上,今年 7 月初,基于端到端架构的自动紧急 制动功能 AEB 已在 Banyan·榕 2.6.5 版本中正式上车,提升响应覆盖 6.73 倍。

4.3.5 智驾供应商:百度模块化端到端赋能萝卜快跑,商汤绝影开始一体化端到端测试

百度于 5 月 15 日发布了面向自动驾驶的端到端大模型 Apollo ADFM。从 2021 年开始,百度 Apollo 将系统中的多个小模型任务逐步整合,Apollo ADFM 实现了感知大模型+规划大模型的 模块化端到端方案,通过对中间结果做隐式传递,实现了端到端的联合训练。整体的数据训练 评测都更为简化,进一步减少了信息损失。该方案已经告别了科研探索阶段,能够满足非常高 的安全标准,亦可解决 L4 无人驾驶的问题。

以 Apollo ADFM 为基础,Apollo 自动驾驶大模型能够迅速泛化。目前只需要 6 个月的时间, 就能在一座新城市实现接近“老司机”的驾驶效果。该技术将搭载于价格仅 20 万元的萝卜快 跑第六代无人车;纯视觉城市领航辅助驾驶产品 ANP3 也将全面应用自动驾驶大模型 Apollo ADFM,并升级为 ASD(Apollo Self-Driving),即将在极越全系车型量产首发。 商汤绝影是行业首个提出感知决策一体化端到端的供应商。面向量产的端到端自动驾驶解决方 案 UniAD 在北京车展上完成上车演示首秀。商汤绝影 UniAD 方案将感知、决策、规划等模块整合到一个全栈 Transformer 端到端模型,实现感知决策一体化。搭载 UniAD 端到端自动驾驶 解决方案的车辆可适配纯视觉的硬件基础,无需高精地图。同时,商汤也依靠世界模型生成更 加精细和复杂的自动驾驶视频数据,给 UniAD 进行有针对性的模型训练。

商汤还前瞻性布局了下一代自动驾驶技术 DriveAGI,进一步向认知驱动进化。DriveAGI 基于 多模态大模型对端到端智驾方案进行改进和升级,具备更强的推理能力、决策能力以及交互能 力,思维模式更接近人类,解决驾驶困难场景能力强。DriveAGI 可以在无高精地图,甚至是针 对某种类型目标 0 样本学习的前提下,仅依靠视觉感知实际道路情况,准确地完成包括大角度 转向、避让占道车辆及施工区域、绕行跑步行人等一系列高难度操作。

元戎启行在北京车展对外展示了其即将量产的高阶智驾平台 DeepRoute IO。DeepRoute IO 基于导航地图应用端到端模型,在导航地图覆盖的范围内,DeepRoute IO 可实现全域点到点 高阶智能驾驶,复杂路况下元戎启行 IO 平台的路口通行成功率近 98%,特殊路口转向成功率 近 90%。IO 平台还设有完善的安全兜底策略,保证驾驶安全,在将要发生碰撞时,系统会启 动安全模型,车辆迅速进入保守策略避免出现安全事故。 DeepRoute IO 的硬件方案支持定制化设计,根据车企的不同硬件设置、不同软件功能要求进行专属定制。首款基于 DeepRoute IO 的解决方案采用 NVIDIA DRIVE Orin 系统级芯片, 200+TOPS 算力,1 颗固态激光雷达,11 颗摄像头,行泊一体,基于导航地图可实现全域、全 时、全场景的智慧领航辅助驾驶功能。

总体看,特斯拉作为端到端路线的引领者具有数据、算力等优势。国内路线智驾领先车企如华 为、小鹏等为加快量产进度,减少过于激进带来的算法缺陷,均选择了模块化端到端路线,以 提升端到端算法的可解释性与稳健性;而理想、商汤等一体化方案在端到端模型的基础上构建 了以语言模型为基础的多模态大模型作为认知能力的补充,同时还包括了世界模型补充测试的 数据集;蔚来的端到端则以世界模型为基础,通过世界模型的时空感知与预测规划决策能力实 现端到端。我们认为因各车企战略选择有差异,端到端路线尚处在百花齐放的阶段,但随着数 据、算力等竞争要素逐渐赶上,端到端路线有望逐渐收敛至一体化结构,并会结合多模态大模 型、世界模型等加强感知、认知、决策能力。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至