2025年汽车行业专题研究:体验向上价格向下,端到端加速落地

  • 来源:华泰证券
  • 发布时间:2025/03/03
  • 浏览次数:540
  • 举报
相关深度报告REPORTS

汽车行业专题研究:体验向上价格向下,端到端加速落地.pdf

汽车行业专题研究:体验向上价格向下,端到端加速落地。高阶智驾逐步由尝鲜阶段向大众用户普及,24年11月L2.5/L2.9级智能驾驶(对应高速和城市NOA)渗透率达到3.5%/10.1%。2025年预计高阶智驾加速迭代:1)体验向上:各家强调体验和好用度,端到端架构预计将加速落地,一方面是全国都能开/接管里程数/车位到车位等硬指标比拼;另一方面各家不约而同强调“拟人化”。2)价格向下:随着技术成熟和降本,当前高速和城市NOA已下探到10/15万内价格段车型,在比亚迪全民智驾等因素催化下,我们预计2025年高速/城市NOA渗透率将分别达16%/14%。端到端架构上限更高、正...

高阶智驾:体验向上,价格向下

25 年,智驾体验不断提升+价格带持续下探。高阶智驾由尝鲜阶段向大众用户普及,成为 必争之地。根据佐思汽车研究,22 年以来 L2 及以上智驾渗透率不断提升。24 年 11 月 L2.5/L2.9 级智能驾驶(对应高速 NOA 和城市 NOA)渗透率达到 3.5%/10.1%。针对不同 用户和价格带,智驾产品出现分层,20 万以上车型追求全场景高阶智驾,比拼端到端、世 界模型等,追求最好的体验;中低端市场的智驾则追求智驾功能的价格带进一步下沉,追 求极致性价比。

(1)体验向上:各家强调体验和好用度,“拟人化”成为关键词。智驾领域的竞争焦点一 直在不断变化,从早期的 L2 级别智驾功能以及高速 NOA 的量产,转变为城区 NOA 的普 及,再到当前的端到端上车等。一方面是硬指标比拼:如全国都能开,接管里程数,车位 到车位等;另一方面各家不约而同强调“拟人化”,如奇瑞智驾系统针对大车,会智能调节 距离和减速避让;拟人化插空变道(预先进行贴边压线)。极氪浩瀚智驾端到端 plus 采用数 字先觉网络,具有记忆,“学习和思考人是怎么开车的”。理想智驾当前可以实现过闸机、 车位到车位,在跨层地库、交通博弈等场景改善驾驶体验,切中用户痛点。而这些背后需 要端到端架构、AI 大模型上车、以及强大的算力和数据支撑。

(2)价格向下:随着技术成熟和降本,中高阶智驾车型价格带持续下沉。随着纯视觉方案、 感知降本、8775 跨域融合方案落地等,智驾持续降本并向中低车型渗透,目前高速 NOA 和城市 NOA 基本下探到 10 万元、15 万元左右级别车型。2025 年 2 月,比亚迪召开全民 智驾发布会,进一步将天神之眼 C 智驾系统带到 10 万以内车型,智驾版车型最低价格仅需 7.88 万元,有望强力推动整个行业中高阶智能驾驶的加速普及。

考虑到 Deepseek 的横空出世以及比亚迪全民智驾的大力推行等因素催化,我们在年度策 略《2024-11-28_华泰证券_政策托底,品牌求进,科技为攻》的基础上调 25 年各级别智驾 渗透率预测。我们预计 2025 年高速 NOA(此处代表具备高速 NOA 但不具备城市 NOA 功 能)和城市 NOA 渗透率将会有明显提升,渗透率分别有望达到 16%/14%。

端到端百舸争流,VLA 和世界模型蓄势待发

端到端架构上限更高、正加速上车,车位到车位大幅提升智驾体验连贯性

理论:端到端架构可实现信息无损传递、上限更高

传统的自动驾驶系统采用模块化部署策略,将感知、预测、规划、控制等功能独立开发, 再集成至车辆中。每个模块负责特定任务,其输入通常来自前一模块的输出。模块化方案 存在着诸多局限,上限较低。(1)模块化方案存在信息损失,非全局最优。(2)模块化方 案下,多任务和多模块部署和训练也会增加计算负担。(3)此外传统模块化方案往往是基 于规则的,泛化性一般较差。种种局限致使模块化方法上限较低,难以达到 L3 乃至 L4 阶 段,或只能在受限场景中应用。随着算力增强以及 Transformer 等算法的发展,模型间的 界限正逐渐变得模糊,端到端架构渐行渐近,逐步替代模块化方案。 端到端方案借鉴人类驾驶的“行为反射式”特点,利用神经网络直接从原始传感器数据映射 出轨迹或控制信号,无需人工预先定义规则、模块间显式接口等,将感知、决策、控制等 流水线过程看作一个整体进行优化。我们认为,端到端架构的核心特征是全部模块都神经 网络化以实现信息的无损传输,不过端到端架构并不一定意味着只用一个网络实现驾驶功 能,而是强调对各环节的无损衔接和整体优化。我们认为自动驾驶架构向端到端演进大致 可以分为四个阶段。

(1)感知“端到端”,在感知端通过 BEV+Transformer 等技术进行多传感器融合,显著提 升了感知的精度和稳定性,实现了模块内部的“端到端”,而在预测-决策-规划阶段,仍然 以规则为主,目前各主流厂商基本已经实现或越过了此阶段。

(2)决策规划模型化,则是在“感知端到端”的基础上,进一步将预测-决策-规划阶段模 型化,采用神经网络进行训练。但在此阶段,感知和预测-决策-规划阶段仍然是两个独立的 模块,两个模块之间通过人为定义接口进行连接,如障碍物位置、道路边界、红绿灯信号 等。由于此阶段各个模块直接是依赖人工定义的接口进行连接,没有实现信息的无损传输 和反向传播,并不属于真正意义上的端到端架构。人为定义接口,往往受限于写规则的人 的抽象表达能力,人为定义接口所表达的信息越明确,那么丢失的信息就越多;而如果人 为定义接口所传达的信息越丰富,对系统硬件和前期研发资源的消耗就越大。

(3)模块化端到端。模块化端到端方法整体采用数据驱动框架,此阶段仍然包括感知和规 控算法模块,但是上文阶段二“决策规划模型化”,感知模块和规控模块通过规则(人工定 义接口)来连接,但在模块化的端到端模型下,感知模块和规控模块采用神经网络连接。 在训练方式上,各模块联合训练,下游的反馈可以直接传递到上游的感知模块,从而能实 现全局优化的效果,比如当系统做出错误的决策时(如发生碰撞或者未能及时响应交通信 号),反馈不仅需要影响决策模块,还需要逆向传播到感知模块。综上,模块化端到端方案 能够输出设计感知、决策等中间结果,增强模型的可解释性,同时保证整体可微可以利用 反向传播进行整体优化,目前小鹏和华为 ADS3.0 的模块化端到端均已实现量产上车。 2023 年 CVPR 最佳论文中的 UniAD,就是模块化端到端自动驾驶方案的典型代表。该模 型将自动驾驶的三项主任务(感知、预测和规划)和四项子任务(目标检测与跟踪、在线 建图、轨迹预测、占用栅格预测)整合到一个网络,利用查询向量(Query)串联起多个任 务。同时,每个模块的 Transformer 架构通过注意力机制进行信息交互,并将信息传递至最 终的规划模块,避免不同任务模块的累积误差。各模块都围绕着最终的规划控制目的去做 调整和优化,同时各模块的编码信息又可以作为中间任务解码显式输出,并针对各个模块 单独进行训练。UniAD 不仅提供丰富的中间表示,又避免了多任务模块的累计误差问题。

(4)One Model/单一模型端到端。从架构的角度来看,随着模型融合的趋势,自动驾驶 系统架构会逐渐从模块化向 One Model 端到端架构发展,不再明确区分感知、决策、规划 等功能,从原始信号输入到最终规划轨迹的输出直接采用同一个深度学习模型。值得注意 的是,模块化端到端是可以输出 BEV 等中间结果的,而 One model 端到端一般不输出中 间结果,理想的车端智驾系统 2-VLM 模型,是 One Model 端到端的典型代表。

落地:端到端方案正加速上车,车位到车位功能成为新衡量指标

各家发力端到端架构,追求智驾更高上限,预计 2025 年加速落地。当前国内智能驾驶第一 梯队大多已经实现城市NOA的全国都能开,智驾头部车企开城数量已不再是最关键竞争点。 2024 年 Q2 以来,头部车企、供应商集中举办智驾发布会,华为、理想、小鹏、蔚来等都 公布了自家的端到端相关进展并提出未来的端到端发展规划,希望通过端到端架构实现更 高的智驾能力上限。各家整体方向相对一致,大多还处于研发阶段或者处于迅速迭代的时 期,具体落地情况百舸争流。我们从车企的研发,车端和云端等角度对头部智驾厂商进行 了梳理。

1、特斯拉:端到端架构下 FSD 迭代加速

特斯拉在智驾特别是在端到端(End-to-End)架构方面,继续保持领先地位。参考 2021 年特斯拉 AIday 发言,当时特斯拉已基本实现各模块的神经网络化,并尝试将各个神经网 络连接起来并实现规划路径的全局最优。特斯拉 FSD 从 V9 到 V13.2 经历了多次重要更新, 涵盖了从纯视觉方案到端到端支持高速道路的功能拓展和架构迭代。但具体的模型细节, 例如其架构、训练方法或优化技术,特斯拉并未公开详细信息。 端到端架构和云端算力支持下,FSD 迭代加速、性能提升显著,FSD 有望在北美以外地区 获批。根据 teslafsdtracker 网站统计,FSDV13 版本的无脱离行程完成率和紧急脱离间隔 里程显著提升,FSD V13.2.x 版本的城市内紧急脱离间隔里程提升至 470 英里,相比 V12.3.x 版本提升显著,相较于 V12.5.x 版本也提升了近一倍。2024 年 7 月财报电话会议上,马斯 克表示将向欧洲和中国监管部门提交 FSD 申请,24年 9月份公司官方 X账号宣布预计 2025 年在中国和欧洲市场推出 FSD,但仍取决于监管部门的批准情况。2025 年 2 月 25 日,特 斯拉在中国市场进行 OTA 更新,其中最值得关注的是“新增城市道路场景的自动辅助驾驶 功能,优化了原有的 NOA(自动辅助导航驾驶)功能,支持识别红绿灯并实现更复杂的路 况处理”,虽然特斯拉在通知中描述为“对现有 Autopilot 功能的 OTA 升级”,但实际上 下放了部分 FSD 功能,或是后续 FSD 正式入华的前兆。

2、理想:“端到端+VLM”24 年 10 月底开启全量推送,智驾落地和迭代迅速。 理想的智驾系统由车端的 DriveVLM 双系统和云端的世界模型组成。在车端,理想的端到 端智驾系统 DriveVLM 由两个子系统组成,分别部署在 AD max 车型的两块 Orin-X 芯片上, 系统 1 是支持传感器输入到轨迹输出的端到端驾驶系统;系统 2 基于阿里的 Qwen-VL 视觉 语言模型的场景理解系统,输出包含对环境的理解,驾驶的决策建议,驾驶的参考轨迹。 而在云端,理想开发生成式世界模型作为仿真验证系统,满足端到端模型能力验证需要。 参考理想的架构设计,我们认为理想系统 1 可以输出 BEV 特征等中间向量,较符合本文模 块化端到端架构特点;而系统 2 可以基于传感器输入直接输出决策建议,较符合 One Model 端到端架构特点。 工程化能力强大,智驾迭代迅速。2023 年行业普遍认为,理想智驾在新势力车企中稍显落 后,2023 年秋季,理想汽车召开了战略会议,明确将智能驾驶作为公司的核心战略,强调 “2024 年要成为智驾的绝对头部”。城市 NOA 方面,理想从 2023 年 10 月份预研无图 NOA, 四个月后开启千人推送,24 年 7 月实现无图 NOA 全量推送;端到端架构方面,从 24 年 7 月份开启内测,10 月 23 日便率先开启“端到端+VLM”全量推送,不到三个月时间便迭代 30 个版本。11 月 28 日,理想汽车宣布,车位到车位智能驾驶全球首家全量推送开启;12 月 31 日 OTA7.0 全量推送,实现高速城市全场景的端到端+VLM。理想智驾的落地和版本 迭代速度惊人,显示其在智驾领域的决心和强大的工程化能力,我们认为理想智驾进步显 著,应已进入第一梯队。

3、华为:ADS3.0 为感知决策两段式端到端,25 年 ADS4.0 将采用“一段式端到端”架构 华为 ADS3.0 为两段式端到端架构,可实现车位到车位的智驾。华为 ADS3.0 版本是基于 GOD 感知神经网络(感知端到端)+PDP 网络(预测规划端到端)+本能安全网络的分段 式端到端。ADS 2.0 版本中的 BEV 网络被纳入 GOD 感知神经网络中,GOD 不仅能识别白 名单和异形障碍物,还能感知道路结构和场景语义,PDP 决策神经网络负责实现端到端的 决策规划。由于端到端系统可能产生大模型幻觉,下限较低,所以华为在系统中加入本能 安全网络,为端到端决策兜底。我们认为本能安全网络的加入提高了系统的下限,在目前 端到端发展水平对智驾体验和安全进行平衡,是较为务实的落地方案。2024 年 12 月,华 为 ADS3.0 推送 VPD 泊车代驾功能和车位到车位功能,且无需事先记忆、不受车位限制等。 根据公司 24 年 10 月智能网联汽车大会发言以及经济观察报报道,华为预计 ADS 4.0 将于 2025 年推出,预计将采用“一段式端到端”架构,将实现高速 L3 级自动驾驶商用及城区 L3 级自动驾驶试点。

4、小鹏:分段式端到端已上车,聚焦云端大模型追求更高上限

小鹏端到端大模型三网合一,模块化端到端架构循序渐进,一套智驾软件标配全车系。2023 年 6 月,小鹏汽车在感知架构 XNet 中开始采用以视觉为中心的端到端方案;2023 年 10 月小鹏汽车宣布 XNet 2.0,能够实现动态 BEV、静态 BEV 和占据网络三网合一;2024 年 5 月 20 日,Xbrain、XNet、XPlanner 组成的端到端大模型上车。我们认为小鹏的端到 端架构仍区分了不同模块,各个模块直接用神经网络进行连接,属于本文所划分的第三阶 段-模块化端到端架构。10 月 24 日,小鹏宣布 AI 直接一套软件适配全车型全车系,不再区 分 MAX、Pro,而智驾方案的统一或有益于研发力量更加集中从而加快迭代速度。11 月小 鹏 AI 科技日宣布,智驾系统将全面升级为“小鹏图灵 AI 智驾”,以 AI 大模型为核心,涵盖 自研的云端和车端大模型,并展示了自研“图灵 AI 芯片”,该芯片专门为 AI 大模型定制, 拥有 40 核处理器,能够支持高达 30B 参数的大模型运行。24 年 11 月小鹏 P7+正式上市, 全系标配图灵 AI 高阶智驾,端到端大模型全面应用。 小鹏聚焦云端大模型,追求更高上限。根据 24 年 10 月 24 日小鹏 P7+智驾技术发布会, 小鹏认为端到端架构可分为三种:1)各个模块内部 AI 化,然后通过算法和人工定义接口 将各个模块连接起来,即我们上文所提及的模块化端到端架构;2)用一个车端的端到端大 模型取代了原本的各个模块;3)第三种路线则先对云端大模型进行训练,然后再通过知识 蒸馏和强化学习等方式部署车端大模型。小鹏认为,直接将大模型部署在车端,模型参数 量受限于车端芯片算力,见效快但上限低。而小鹏选择聚焦云端大模型,小鹏的云端大模 型参数量是车端模型的 80 倍,并且也引入了世界模型进行仿真测试和强化学习,上限更高。

5、蔚来:自研 NWM 世界模型前瞻架构,但落地面临较大挑战

2024 年 7 月蔚来发布引入世界模型 NWM(NIO World Model)的端到端智驾架构,正在 研发中,预计 2024 年四季度开放体验,我们认为其属于 One Model 端到端架构。蔚来世 界模型架构前瞻,但工程化落地难度大。蔚来的 NWM 世界模型试图在车端进行世界建模 和实时推演,在架构上具有前瞻性,但也面临显著的工程化挑战。蔚来智驾架构直接从模 块化方案越过“模块化端到端”方案到世界模型路线,这一转型也使得许多原有模块化方 案的技术积累在新架构中可能作用有限,除了作为备用方案的“兜底”之外,大部分需要重新 研发和适配。从发布会演示来看,NWM 在生成视频时无法准确还原路牌上的文字,表明模 型当前阶段对物理世界的细节理解和再现仍然存在不足。NWM 世界模型的优势在于能够实 时生成和推演多个可能的轨迹,对车端芯片算力也提出了更高的要求。蔚来 24 年 7 月已落 地行业首个端到端架构的 AEB 功能。据公司宣传,相较于标准 AEB,端到端架构 AEB 在 路口场景方面的紧急制动正确响应(概率)提升了 5.2 倍。

6、小米:HAD(Hyper Autonomous Driving)采用端到端+VLM 架构,12 月底推送先 锋版可实现车位到车位。小米智驾系统 HAD 采用端到端+VLM 架构,上限大幅度提高的同 时下限有保障。2024 年 11 月 16 日小米汽车宣布启动端到端大模型全场景智能驾驶内测, 12 月 31 日开启先锋版推送,适配小米 SU7 Pro 和小米 SU7 Max 车型,25 年 2 月已经开 启万人团测试。该系统能够实现从车位到车位的高阶智能驾驶场景,具备高精度动态驾驶 能力、窄路和复杂场景适应能力,以及自动泊车功能。此外 2024 年 11 月直播中,雷军提 及目前小米的端到端智能驾驶技术的大模型已经学习了 300 万视频片段,预计 24 年底将达 到 1000 万视频片段。小米在智驾领域三年已经投入 55 亿元人民币,未来在智能驾驶项目 上的资金投入将上不封顶。

7、极氪:智驾迭代迅速,浩瀚智驾 2.0 采用两段式端到端架构。极氪 2023 年 12 月正式转 向全栈自研,2024 年 8 月实现量产上车端到端大模型;2024 年 10 月全国分批推送无图城 市 NZP,计划 2025 年初全国分批推送;2025 年上半年计划全量推送车位到车位(D2D)。 极氪浩瀚智驾 2.0 采用 E2E(端到端架构)+MLM(多模态大语言模型)+数字先觉网络, 使用人驾数据的训练,形成“肌肉记忆”。

8、智己:与 Momenta 深入合作,一段式端到端已量产。智己汽车在智驾领域和 Momenta 深入合作,2024 年 10 月 28 日智己汽车发布一段式端到端大模型与 IMAD3.0 最新迭代。 Momenta CEO 曹旭东介绍智己和 Momenta 合作的“一段式端到端直觉式智驾大模型”, 将 感知与规划整合进一个大模型,由各种传感器的原始数据输入直接生成车辆的路径规划信 息,并通过 “长短期记忆模式”训练智驾大模型,大幅节省训练成本并提高训练效率。

9、零跑:智驾采用追随战略,端到端架构起步较晚。零跑汽车在智驾方面采用追随战略, 城市 NOA 和端到端架构进展相对较慢。2024 年公司智驾研发人员有所扩充,并成立专门 的端到端研发团队,根据公司规划,25 年有望推出端到端架构。25 年 3 月 10 日零跑 B10 将开启预售,作为 15 万元级别车型将搭载激光雷达,并上车端到端智驾大模型,支持 NAP 领航辅助等高阶智驾功能,推动高阶智驾普及。

端到端架构落地后,车位到车位功能有望大幅提升智驾体验连贯性,国内理想和华为已经 实现全量推送。端到端架构上限更高,而在实现城市 NOA 功能上车和全国都能开之后,车 位到车位成为新的智驾衡量指标。车位到车位打通停车场到公开道路、公开道路到园区、 园区地面到地下车库等多种场景,强调了智驾应对复杂路况时(尤其是面对闸机/ETC 时) 的连贯性,实现全速域可用、全闸机通行和全场景的泊车,切实改善用户智驾体验。 目前,理想在 24 年 11 月底已经全量推送“车位到车位”,华为于 24 年 12 月底实现全量推 送,并且实现无需实现记忆,首次驶入陌生停车场即可使用。小米、小鹏、特斯拉都开启 了不同程度的内测,都预计 25 年开启全量推送,极氪则预计 25 年一季度分批推送,二季 度全量推送。需要注意,车位到车位功能实现有两种路线:目前理想车位到车位功能,在 停车场和公开道路上分别激活泊车和智驾领航模式;而华为小鹏等则通过一套模式打通全 场景,实现车位到车位功能时界面一直保持智驾 NOA 画面。

发展趋势:一段式或是最终方向,VLA 和世界模型蓄势待发

架构:一段式端到端或是最终方向,众多厂商跟进

一段式开发难度更大,但或是端到端架构的最终形态。关于端到端两段式和一段式的优缺 点目前还存在一定争议,部分观点认为“一段式端到端”虽然在信息传递的无损程度上更 具优势,但一段式端到端模型的“黑盒”程度更高、缺乏透明度,工程师在调试系统决策 逻辑时也面临挑战,可能导致“下限更低”。不过我们认为:当两段式端到端架构逐步成熟 并验证其稳定性后,行业趋势将自然向一段式架构过渡。特别是随着算力的不断提升以及 数据闭环的优化完善,一段式端到端在应对高复杂场景时的性能上限更加显著。从技术路 径来看,一段式端到端已逐步成为行业发展的明确方向。 Momenta、华为、博世等众多厂商均推出或正在推进“一段式”端到端架构。以 Momenta 为例,2022 年,Momenta 开始基于深度学习开发决策模块,当年年底量产深度学习的高速 NOA。2023 年底,Momenta 将感知与规划模块合并,实现了感知和决策的两段式端到端 模型。目前,Monmenta 智驾大模型已发展至第五代,并已将感知与规划整合进一个大模 型中,即 One model 形式端到端架构。截至 2024 年 10 月,Momenta 量产定点的主机厂 包括上汽、一汽、比亚迪、广汽、长城、丰田、通用汽车、梅赛德斯奔驰等多家 OEM,技 术实力受到广泛认可,但大部分配套车型销量不高,智驾方案缺乏爆款车型支撑。我们认 为此次发布的量产智驾大模型有望提升智能驾驶的体验感,同时吸引更多 OEM 与 Monmenta 达成合作,帮助 Momenta 进一步打开下游市场。据经济观察报和 36 氪报道,华为车 BU 也 在攻入一段式端到端方案,预计 25 年 ADS4.0 将采用“一段式端到端”架构;此外包括商 汤绝影,博世等供应商也都明确表示会在 2025 年量产一段式端到端无图 NOA 方案。

AI 大模型:规则驱动转向 AI 大模型和数据驱动,VLA 和世界模型蓄势待发

端到端架构下算法由规则驱动转换为 AI 大模型和数据驱动,而 LLM,VLM,MFM 等各类 基础模型有望为自动驾驶带来新维度上的能力。我们认为,端到端(End-to-End,E2E) 是一种相对于传统模块化设计方案的智能驾驶系统架构。它强调从输入到输出的直接映射, 减少了中间的感知、决策、规划等独立模块。端到端本身属于架构层面的概念,与模仿学 习、强化学习、LLM、世界模型等技术手段/方法并不是同一层面的概念。类似于 EE 架构 从分布式架构升级到域集中式架构、再到中央计算架构的过程,在每一个特定的架构阶段, 各厂商可以采用不同的算法和硬件来实现。因此,即使是在相同的 EE 架构模式下,也会有 表现差异巨大的系统。One Model 端到端架构也是如此,它可以基于传统的神经网络实现, 也可以引入生成式大模型,或者通过世界模型的方式进行扩展。不同的实现方式会带来不 同的性能和特性。

VLA(Vision Language Action)模型或是端到端架构的下一代关键技术演进方向,通过 多模态融合显著提升了信息处理效率、模型能力和决策透明度,元戎启行和理想均已经在 研究 VLA 模型。VLA 较 VLM 增加了对物理动作的生成与控制能力,能够直接将视觉和语 言输入转化为具体的动作指令。根据元戎启行观点,相较于传统依赖独立感知和决策模块 的“两段式”架构以及“VLM+端到端”的组合方案,VLA 架构通过深度整合视觉、语言和行为 等多模态信息进行端到端训练,从根本上减少了信息传递过程中的损耗,并显著提升了模 型的泛化能力和对复杂驾驶场景的理解能力。VLA 模型在训练过程中不仅接收视觉信息, 还融合了语言和行为模态的数据。这种多模态的融合使得模型能够学习到视觉输入与语言 描述之间的对应关系,从而在做出驾驶决策的同时,也能生成相应的自然语言解释。例如, 模型可能会解释“我识别到前方有行人(视觉),根据交通规则我应该减速让行(语言和行 为规则),因此我执行了刹车操作(行为)。” 这种将感知、推理和行动与语言描述直接关 联的能力,使得模型的决策过程不再是一个“黑箱”,而是变得可以理解和追溯。

VLA 模型另一优势是跨领域通用性,但其落地对车载计算平台的算力提出了更高要求。 凭 借其底层多模态融合的特性,VLA 模型展现出超越汽车领域的潜力,未来有望应用于包括 机器人在内的更广泛的智能设备,实现技术复用和规模效应。然而,VLA 模型强大的性能 依赖于高性能计算平台的支撑,理想车端双 orin-X 芯片运行 E2E+VLM 算力已经比较吃紧, 部署 VLA 模型可能需要 NVIDIA DRIVE Thor 等算力达到千 TOPS 级别的高端芯片。未来 具备更强芯片整合能力和垂直整合能力的智驾供应商有望在 VLA 技术的竞争中占据先发优 势。目前行业头部竞争者如特斯拉、华为、蔚小理、Momenta 等都在逐渐走向软硬一体, 针对自研模型定制化开发更匹配的智驾芯片,可以做到最大程度的优化。

世界模型是另一重要趋势,其在对物理世界理解深度和应对未知场景泛化能力方面潜力很 大。 世界模型的核心优势在于其能够模拟真实世界的运行规律,使自动驾驶系统能够像人 类一样进行推理和预测,使其不仅能基于感知获取的信息进行预测,更能对未曾训练过的 数据形成泛化理解,从而做出更可靠的决策。地平线提出了世界模型的两个长远价值:更 准确的世界理解和更强的泛化能力,前者有助于减少智驾系统的代码量和延迟,后者则能 使系统对复杂驾驶环境形成通用理解,世界模型有望成为自动驾驶领域的基础模型,支撑 各种具体任务的研发构建,而不仅仅是作为一种仿真工具。小马智行 CTO 楼天城更是将世 界模型评价为自动驾驶当前最重要的事情,认为其能构建出超越人类驾驶能力的复杂世界, 最终训练出更安全的自动驾驶系统。 目前世界模型的主要应用集中于数据仿真和云端模型优化,但其在车端落地仍面临诸多挑 战。 一方面,世界模型通过生成式模型,能够创建多样化的、包含 corner cases 的仿真数 据,有效弥补真实数据覆盖的不足,加速模型训练并提升其鲁棒性。另一方面,在云端, 世界模型可以作为“教练”,通过评估车端系统的表现,反向指导模型的优化和迭代,提升训 练效率。然而,将参数规模庞大的世界模型直接部署在算力受限的车端,不过目前将世界 模型应用于车端,还有不少障碍:1)车端算力不足以支持大的世界模型运行;2)网络带 宽不足;3)运行速度太慢。例如理想汽车将世界模型作为云端“考官”检验车端系统,蔚来 汽车则提出了车端世界大模型的规划,但同时也承认直接在车端运行世界模型存在落地困 难。

DeepSeek 横空出世,有望加速 VLA 和世界模型上车。(1)DeepSeek 的蒸馏技术可将云 端大模型的推理能力高效迁移至车端轻量模型,有望在保持高性能的同时显著降低计算开 销,为 VLA、世界模型等复杂模型在车端部署扫清算力障碍。(2)理想、极氪、元戎等使 用或计划 VLM、VLA 多模态大模型上车,DeepSeek 模型表现出的高效训练、良好的多模 态处理能力、高效的蒸馏方式,有望吸引车企的尝试,甚至后续直接替代车企原有的 VLM/VLA 的模型选择。

挑战:端到端对算力和数据提出更高要求,主机厂组织架构也需要适应调整

技术:端到端架构对数据和算力提出更高要求

端到端架构逐渐成为智驾领域的主流,相较于传统模块化方案上限更高,但也在算法、数 据和算力这三方面对厂商提出了更高的要求和挑战。算法层面,端到端架构可以通过神经 网络直接学习从感知到规划的全流程映射,不再依赖模块化的人工设计,从而减少接口间 的误差累积,提高系统的整体上限。数据层面,相较于模块化,为实现端到端架构更高的 上限,不仅需要大量高质量、标注完整的原始数据,强调场景的丰富性和数据标注的精准 度,更需要构建高效的数据闭环,不断迭代优化算法能力,避免模块化方案中因数据割裂 而带来的信息缺失和训练偏差。算力层面,端到端模型参数量大,计算复杂度高,对算力 的需求显著增加,特别是在云端训练和车端部署的协同优化上,云端的大模型训练需要通 过剪枝和压缩(蒸馏)才能部署到车端,以保证推理效率。总体而言,端到端架构带来了 更高的技术上限,但厂商也需要在算法创新、数据闭环和算力投入上进一步加强,切实提 升智驾能力和用户体验。 数据层面:数据驱动成为主流,考验厂商数据闭环能力。在端到端架构下,数据的价值不 仅体现在规模上,更体现在数据质量、标注精度和数据闭环的构建与应用等多个层面。

① 数据量:端到端架构由数据驱动,大规模数据有助于模型的泛化能力和长尾场景覆盖。 例如,特斯拉、理想和小鹏等企业通过其量产车队积累了大量驾驶数据,涵盖了不同的道 路类型、气候条件和复杂驾驶场景,显著提升了系统对实际路况的适应性。特斯拉通过“影 子模式”收集驾驶数据,能够捕捉驾驶员在复杂情景中的反应,这些数据被用于进一步训 练模型,使其在面对特殊情况时表现更加可靠。相比之下,专注于自动驾驶技术的初创公 司或智驾车型销量较小的企业可能在数据量方面处于相对劣势。

随着 AI 大模型技术的发展,合成数据和仿真测试等也开辟另一条途径。由于早期合成 数据的质量和技术限制,在真实感、细节还原和数据多样性方面存在限制,合成数据 只占据了智能驾驶训练数据的一小部分,通常估计在 5%到 10%之间。然而随着技术的 进步,特别是 AI 大模型和世界模型的发展,合成数据的质量得到了显著提升,应用场 景更加广泛,特斯拉和小鹏等企业均明确表示过合成数据在其模型训练中发挥重要作用。 合成数据可以低成本地增加训练数据集的规模,同时增加场景的多样性,并有效生成长 尾场景。国产 OEM 已经在积极探索仿真驾驶数据以弥补真实驾驶数据的不足,比如理 想和蔚来通过世界模型生成驾驶视频训练端到端模型。此外建立数据共享平台或许是另 一个可以探索的方向,可以减少重复工作,加速整个行业的发展,但可能存在隐私保护 和数据安全等担忧。

② 数据质量:在端到端架构中,不仅需要收集海量的数据,更重要的是数据的质量及其 与实际驾驶场景的相关性。高质量的数据需要具备对现实场景的高度代表性,确保模型 在训练中学习到有效的信息。例如,理想汽车利用“老司机”策略,从车主中挑选 3% 的高评分驾驶员数据作为高质量训练样本,同时确保了训练数据规模和相关性,以提高 模型对实际驾驶情况的准确性。华为等车企也在通过用户驾驶数据的深度挖掘,不断丰 富和完善其训练数据集,这些高质量的数据不仅包含常规驾驶条件,还涵盖了不同天气、 道路状态以及复杂交通场景,有助于提升模型在面对各种真实驾驶条件时有较高的稳定 性和应对能力。此外我们认为 DeepSeek 有望成为车企在智能驾驶数据端一个高效有 力的工具,可用于辅助生成合成数据、数据标注等。

③ 数据标注:标注的质量和精度是决定数据可用性的关键,端到端架构下,自动标注运 用更加广泛,同时数据标注质量要求更高。 端到端架构对数据的全面性、标注的精确度以及一致性要求更高。在模块化架构中, 数据标注通常是为每个模块单独设计的。举例来说,感知模块需要标注车辆、行人、交 通标志等内容,决策模块则可能需要与道路条件和其他车辆行为相关的数据。这种模式 下,标注数据的类型和范围往往是局限于特定模块需求的,因此标注的细致程度会受到 模块需求的限制。同时,由于各模块独立开发,存在数据割裂的问题,不同模块的数据 标注标准可能有所不同,这会导致系统整体性能在融合时容易出现接口误差和信息缺失。 相比之下,端到端架构要求数据标注涵盖系统从输入到输出的整体流程,因此对数据的 多样性和标注的准确性提出了更高的要求。在端到端架构中,数据标注不仅要满足感知 的需要,还必须为整体决策和控制提供足够的信息支持。因此,标注往往需要更精细 的层次,从而使模型能够学习到从环境感知到路径规划和车辆操作的完整映射。标注错 误或不一致的数据可能会对整个模型的学习效果产生较大影响。 此外,自动化标注技术在端到端架构下的运用更加普遍。传统的模块化标注多依赖人工, 尤其是在特定场景和细节的标注上,人工作业不仅费时,还容易出现主观误差。而在端 到端架构下,由于数据量庞大且标注需求更加复杂,自动化标注成为提升标注效率和减 少误差的重要手段。例如,Waymo 和特斯拉等公司广泛使用 AI 辅助的自动化标注系统, 通过语义分割、多边形标注等技术精细化处理每个场景中的所有物体。这种自动化过程 大幅减少了手工标注中的主观偏差,并能通过反复校验实现标注的一致性和高质量,从 而确保模型在不同情境下的可靠学习。

④ 数据闭环能力:数据闭环能力是端到端智能驾驶发展的重要驱动力,决定了系统能否 快速迭代和持续改进。高效的数据闭环涵盖从数据收集、标注、模型训练到测试再到反 馈的完整流程。例如,特斯拉利用其影子模式,持续收集大量真实路况数据并进行快速 迭代,这使得模型可以在短时间内得到优化并及时反映到产品中。理想汽车通过筛选“老 司机”数据来构建高质量的训练样本,形成数据的闭环,能够迅速应对复杂场景并不断 优化系统表现。模块化方案的数据闭环往往更为割裂,各个模块分别进行数据的收集、 标注和优化,导致整体系统的反馈速度较慢,而端到端架构依赖统一的数据流,从输 入到输出一体化学习,使得改进过程更为高效。数据闭环不仅能够加速系统的自我更新, 还能最大化地提升算法、数据和算力之间的协同效果,形成强大的技术飞轮。 云端算力层面:随着算法迭代以及数据量攀升对于算力需求持续提升,国内厂商加码算力 投资。随着端到端架构落地和智驾算法中大模型的引入,算法迭代更加倾向由数据驱动, 而随着量产车数量增加等各厂商需要处理和训练的数据量也在飞速增加,这些都要求国内 厂商对于算力投资持续加码,其中最重要表现就是超算中心建设。以华为和比亚迪为例, 华为在 2023 年 6 月云端算力约 3.5EFLOPS,23 年 8 月初提升到 5EFLOPS,2024 年 9 月已经达到 7.5EFLOPS,并且模型训练和迭代速度得到显著提升(24 年 9 月时,每 5 天 模型就可以迭代一次)。2024 年及之前,比亚迪在智能驾驶领域的公开数据较少,目前其 云端算力主要包括自建和租赁两种,我们推测其将快速提升其云端算力储备,以支撑“天神 之眼”城市记忆领航功能的年底 OTA 及后续城市 NOA、端到端架构的研发。

DeepSeek 的出现:短期或缓解云端算力紧缺,但长期云端算力需求仍将持续增长。 MOE/MLA/MTP 等方式提升模型性能和训练效率,有望借鉴相关技术加速智驾模型训练速 度并降低训练成本,从而加速智驾系统迭代。在目前特斯拉在云端算力大幅领先的背景下, DeepSeek 的低成本训练模式,使得国内厂商能够利用相对有限的算力资源开展大模型训 练,获得追赶的重要窗口期。不过尽管 DeepSeek 技术降低了单次模型训练的算力需求, 但长期来看,随着模型复杂度的持续提升、应用场景的不断拓展以及数据规模的指数级增 长,自动驾驶对云端整体算力的需求仍将呈现长期增长趋势。 车端算力:DeepSeek 高效的蒸馏技术可启发车企创新,使得车端算力要求降低,加速 VLA、 世界模型等上车,但或存在能力天花板。在实现同等智驾体验的情况下,预计对车端算力 的需求将降低;而同等算力下,或可以实现更多智驾功能。但需要注意的是,有学者认为, 蒸馏技术虽然可以提高模型训练效率,但借此开发的模型无法超越基础模型的能力,且可 能导致研发人员为了快速取得成果而放弃对基础模型的探索。故未来云端车端协同分工或 将会是:云端模型负责复杂模型的训练和迭代,不断探索上限;车端模型则更注重效率和 成本,将云端模型蒸馏到车端,负责实时推理和决策。

AI 算力产业链上游是算力基础硬件设施,包括元器件、ICT 基础设施、其他硬件设备等。 中游是算力网络与平台,提供 IDC 服务、云计算服务、以及各类算力网络服务等,以电信 服务商及互联网企业布局较多。下游应用主要有公众用户和政企用户两大类,广泛应用于 互联网、金融、公共事业、电信、智能驾驶等领域。由于 AI 热潮以及美国政策限制,高算 力 AI 芯片较为稀缺,故国内主机厂在进行超算中心建设时候大多选择和云服务提供商合作, 比如蔚小理和小米的算力中心分别和腾讯云、阿里云、火山引擎以及金山云合作。

除算力大小以外,带宽也是重要限制因素。随着模型复杂度的增加和数据量的爆炸式增长, 对算力的需求也在不断攀升。硬件峰值算力的增长速度跟不上模型算力需求的增长,而内 存性能的增长则更加滞后,产生“存储墙”(memory wall)问题,即模型算力需求>硬件 峰值算力>内存性能增长,从而限制了整体系统的性能。针对这一限制,目前主要解决方 法包括研发和使用高带宽存储芯片(HBM 等),优化数据中心网络架构,针对 AI 的定制化 芯片等。

管理:打破原有研发团队架构,更强调人才质量

端到端架构要求厂商打破原有各个模块之间的壁垒,实现跨功能团队的协作。在端到端智 驾架构以前,传统的自动驾驶是分模块的,通常包含感知、预测、规划、控制等,智驾开 发人员的投入相应地也分布在各个环节。但在端到端智能驾驶架构下,需要对原有的组织 结构进行重组,如蔚小理智驾均进行团队调整,拥抱端到端。团队调整前,蔚来智能驾驶 研发部分为感知、规控和集成等部门,调整后,感知和规控团队合并为大模型团队,集成 团队重组为交付团队,2024 年 12 月任少卿直管大模型部门,推进 “端到端” 量产交付。 小鹏汽车在智驾部门下成立了 AI 部门,专门推进端到端等技术。理想汽车也为端到端模型 单独成立了一个团队,夏中谱被任命为“端到端”智能驾驶量产负责人,直接汇报给智驾 负责人郎咸朋。相较而言,我们认为长城、吉利等传统主机厂内部架构层级相对更多,组 织架构进行快速调整的难度可能更大一些。

模块化步入端到端,此阶段各家 OEM 更追求人才质量而非数量,从熟悉算法的工程师,转 向未来可能更加强调 AI 人才。相较于模块化方案,端到端架构简化了系统架构,减少了模 块间接口的复杂性,降低了算法开发的复杂性,不需要人工设计各种规则,同时共享主干 网络也可以提高了计算效率。此外在规则时代,代码行数非常多,而端到端架构下代码管 理的工作量也大大降低,如特斯拉 FSDV12 版本转向端到端架构后,代码从 30 多万行减到 2000 行。在此阶段,各家 OEM 更加追求人才质量而非数量。小鹏智驾负责人李力耘认为 在规则时代,公司需要熟练掌握计算机语言、算法的人,但是现在更希望有能够熟练驾驭 AI 工具去解决问题的人才。特斯拉以 200-300 人的智驾团队,交付全世界最大的自动驾驶 车队,表明端到端架构对人才质量的要求远高于数量。2024 年国内智驾人才变动十分频繁, 以比亚迪为例,2023 年以来就引入了周鹏(前百度舱驾融合智驾技术负责人)、许凌云(高 合汽车原智能驾驶总监)、廖杰(地平线原智能驾驶研发总监)、张立存(沃尔沃汽车原自 动驾驶总监)、许迎春(理想汽车原算力平台副总裁)等一众技术人才。

落地:端到端架构下智驾快速迭代,工程化能力愈发关键

端到端架构方向明确,各家加速投入、快速迭代。端到端架构下,众多前沿论文提供的开 源模型,各家车企的技术分享会等等,当前虽然在具体落地层面仍然各不相同,但是技术 路线大方向相对明确。在此背景下,各家均在加大投入,智驾逐渐进入了“工程性”阶段, 快速迭代特征显著。车企方面举例而言,理想 5 个月的时间便实现端到端的全量推送,2-3 天便进行一次版本迭代,近期模型训练数据已经达到 582w clips。极氪 23 年 12 月面转向 自研之后,24 年 8 月实现端到端量产上车,12 月底全国全量推送无图城市 NZP,25 年推 送车位到车位功能。

智能驾驶加速迭代,工程化能力愈发重要。尽管技术架构的先进性很重要,但最终的落地 和用户体验才是关键。在端到端时代,单纯的算法很难评价其优劣。比如蔚来汽车虽然架 构前瞻,但目前还未正式落地,而从实际体验来看,模块化端到端的华为智驾效果更好。 当前各家智能驾驶总体架构趋于一致,传统车企借鉴先行者方案,减少研发弯路,但工程 化能力成为关键差异点,影响最终落地成效和竞争格局。2025 年智能驾驶竞争领域端到端 架构(乃至 VLA 和世界模型等模型)的推出或上车是竞争焦点之一,而我们认为最终智能 驾驶仍然是比拼落地能力(针对已经提出端到端架构和智驾规划的车企)和用户体验的角 逐(针对已经上车端到端架构的车企)。能否通过高效的工程化能力实现快速量产和用户需 求响应,是企业在智驾下半场能否胜出的重要因素。 直接衡量企业工程化能力较为困难,但我们认为或许可以从以下几个角度对工程化能力进 行观察。除了硬性的研发费用,研发人员数量以外,还存在很多不同的影响因素。(1)落 地速度:理想等新势力凭借敏捷的组织架构和高效的工程执行力,展现出较强的落地速度, 如端到端+VLM 方案在三个月内就实现全量推送。相比之下,传统车企如长城和上汽以及奇 瑞,由于内部流程和组织调整的复杂性,往往多线研发,落地进度相对缓慢。(2)迭代速 度:特斯拉和理想的智能驾驶版本迭代周期分别为 6-7 天和 2-3 天,工程化能力支撑了其迅 速响应用户需求、提升智驾体验。而传统车企的迭代速度仍有待观察。(3)数据闭环能力: 在端到端架构下,数据的收集、处理及应用能力是决定技术落地成败的重要因素。工程化 落地需要大量真实场景数据的支撑,数据越全面,智能驾驶系统就越能应对复杂场景,从 而有效提升用户体验。当然用户的实际体验和反馈是衡量工程化成效的最终标准,能否有 效解决用户痛点,提升用户对智能驾驶功能的信任和依赖,提升消费者智驾选购比例和付 费意愿,是对工程化能力的最好检验。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至