您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [东吴证券]:汽车行业深度报告:AI系列深度12期:从模块化到端到端 - 发现报告

汽车行业深度报告:AI系列深度12期:从模块化到端到端

交运设备 2026-08-04 东吴证券 杨静🍦
报告封面

AI系列深度12期:从模块化到端到端 2026年08月04日 增持(维持) 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn ◼端到端的核心,是以原始传感器输入直接映射规划或控制输出,并通过整体可微、全局优化的方式训练系统。该概念最早来自网络工程语境,进入机器学习后逐步转化为输入端到输出端整体训练的方法论;在自动驾驶中,ALVINN、DARPA DAVE、NVIDIA DAVE-2、UniAD和特斯拉FSD v12共同构成其从学术探索到产业落地的演进脉络。我们将端到端理解为训练方法、系统架构和技术思想三重属性的组合。 ◼端到端与模块化流水线的差异,在于是否将感知、预测、规划和控制拆成多个人工定义模块。模块化系统可解释、可调试,但信息容易在模块边界损失,且规则维护成本较高;端到端系统可让模型直接围绕最终任务优化,信息传递更完整,但可解释性、可控性和安全验证难度更高。2024年以来,一段式与二段式成为中国智驾行业讨论焦点。 ◼端到端并不等于完全取消规则,更准确的表述是替代人工规则在主决策回路中的主导地位。特斯拉FSD v12以神经网络替代大量手写C++规则,是该趋势的重要标志;但规则仍会保留在安全兜底、形式化校验、冗余备份和合规约束中。由此看,端到端普及是主决策范式从人工规则转向数据驱动模型,而非规则系统消失。 相关研究 《智能汽车主线周报:曹操出行开放Robotaxi无安全员测试,看好智能化》2026-08-03 ◼从应用进展看,自动驾驶由特斯拉率先量产推动,中国厂商2024年集中跟进,并在2025年前后进一步向VLA和世界模型演进;机器人领域自RT-2起即以VLA形态采用端到端;数字AI中端到端已是默认范式,通常不再作为单独技术标签。例外和分歧仍存在,如Mobileye复合AI系统、Zoox模块化路线等。 《AI系列深度11期:大模型如何进行模仿与强化学习?》2026-08-03 ◼端到端、VLA与世界模型不是替代关系,而是处于不同能力层级和功能维度。VLA可视为端到端在多模态理解与动作生成方向上的延伸;世界模型关注环境状态预测和场景生成,可作为云端数据引擎、仿真训练场或车端模型组件。产业实践中,三者更可能形成组合方案,而非线性替代关系。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.1.概念溯源:从网络工程术语到机器学习范式............................................................................41.2.定义梳理:整体可微、全局优化是公认内核............................................................................41.3.发展路径:学术奠基、产品催化与产业跟进............................................................................51.4.属性辨析:架构、方法论还是思想............................................................................................61.5.技术原理:端到端与模块化对比................................................................................................6 2.1.一段式与二段式的界定与阵营....................................................................................................72.2.核心议题:端到端是否是对"规则算法时代"的替代.................................................................8 3.端到端应用:自动驾驶率先量产,机器人以VLA承接....................................................................9 3.1.自动驾驶:特斯拉率先,中国厂商2024年集中跟进..............................................................93.2.机器人:自RT-2起即以VLA形态采用端到端......................................................................103.3.数字AI:端到端是默认范式,通常不再单独标注.................................................................10 4.端到端与VLA:演进与包含,而非二选一.......................................................................................11 4.1. VLA的概念起源与技术原理......................................................................................................114.2.关系辨析:技术原理与产业口径的双重验证..........................................................................114.3.从快慢系统看:VLA强化端到端的推理与泛化.....................................................................11 5.端到端与世界模型:一个出动作,一个预测世界............................................................................12 图表目录 表1:“端到端”代表性定义对照...........................................................................................................5表2:端到端发展关键时间线...............................................................................................................6表3:一段式与二段式端到端对比.......................................................................................................8表4:主要玩家端到端采用时间一览.................................................................................................10 1.端到端:从输入到动作的整体优化框架 在表征、训练范式与LLM/VLM/VLA之后,端到端是理解智能驾驶和机器人落地路径的关键工程范式。其核心在于以可整体训练的神经网络压缩传统模块化流水线,使系统从原始输入直接生成规划或控制输出。端到端强调训练链路和系统架构的整体优化,VLA强调视觉、语言与动作的统一建模,世界模型则强调对环境动态的预测与生成。 1.1.概念溯源:从网络工程术语到机器学习范式 “端到端”的词形最早成型于计算机网络领域,与机器学习语境并不相同。Saltzer、Reed与Clark在1981年会议论文和1984年ACM TOCS修订版中提出端到端论证,核心含义是某些功能只有依靠通信系统两端应用才能完整实现,不宜由网络中间层承担。该语境下的端到端强调功能位置,机器学习语境下的端到端强调输入到输出的整体训练,两者仅共享减少中间环节的思想隐喻,不应直接混同。 机器学习语境下,端到端驾驶的早期代表是1988年CMU的ALVINN,但“端到端”一词属于后世追认。Pomerleau在NIPS 1988发表的ALVINN论文提出三层反向传播网络,以摄像头图像和激光测距数据为输入,直接输出车辆沿道路行驶方向。ALVINN原文并未使用end-to-end表述,NVIDIA在2016年官方博客中将其追认为端到端训练神经网络驾驶汽车的早期概念验证。 “端到端学习”作为驾驶任务标题级术语,可考至2004至2005年。LeCun等在1998年提出图变换网络,使多模块系统能够通过梯度方法全局训练并最小化整体性能指标,为端到端方法论奠定基础。2004年DARPA资助的DAVE项目最终报告以AutonomousOff-Road Vehicle Control Using End-to-End Learning为题,2005年LeCun等在NIPS论文中进一步明确将原始输入图像映射为转向角。 2006至2015年,端到端范式在语音、翻译和强化学习等领域加速落地。Graves等在2006年提出CTC,使语音识别可在无需人工对齐的情况下训练;Sutskever等在2014年提出seq2seq,将其表述为通用端到端序列学习方法;百度Deep Speech同年以端到端语音识别为标题;DeepMind DQN在2015年以屏幕像素为输入、直接输出游戏动作。至2016年前后,端到端已成为深度学习的通用范式。 1.2.定义梳理:整体可微、全局优化是公认内核 学界与产业界对端到端的定义表述各有侧重,核心要素一致。NVIDIA在2016年给出操作性定义:"与把问题显式分解为车道线检测、路径规划和控制的方法相反,我们的端到端系统同时优化所有处理步骤"。学界目前最常引用的定义来自IEEE TPAMI综述:端到端框架"利用原始传感器输入生成车辆运动规划,而非专注于检测、运动预测等单项任务;与模块化流水线相比,端到端系统受益于感知与规划的特征联合优化"。中国业界则更强调,端到端能够减少模块间的信息损耗,并实现感知、决策与控制的全局联合优 化。 综合上述定义,端到端系统通常具备三项核心特征:一是输入端直接接收原始或近原始传感器数据;二是输出端直接生成运动规划或控制指令;三是主体处理链路具备可微性,可围绕最终任务目标进行整体优化。 1.3.发展路径:学术奠基、产品催化与产业跟进 2016年NVIDIA DAVE-2使端到端驾驶路线重新受到关注。NVIDIA在2016年4月发布End to End Learning for Self-Driving Cars,DAVE-2系统使用9层CNN和约72小时驾驶数据训练,仅以人类转向角为监督信号,并在未显式训练道路轮廓检测的情况下实现演示级自主行驶。2017年Wayve在英国剑桥成立,提出区别于规则栈和高精地图AV1.0的自动驾驶技术路线,推动端到端学习成为自动驾驶路线讨论的重要变量。 2023年UniAD获CVPR最佳论文,端到端登上学术制高点。上海人工智能