核心观点与定义
- 端到端的核心是以原始传感器输入直接映射规划或控制输出,并通过整体可微、全局优化的方式训练系统。该概念源于网络工程,进入机器学习后转化为输入到输出整体训练的方法论,在自动驾驶中经历了ALVINN、DARPA DAVE、NVIDIA DAVE-2、UniAD和特斯拉FSD v12的演进。
- 端到端系统具备三项核心特征:输入端直接接收原始或近原始传感器数据;输出端直接生成运动规划或控制指令;主体处理链路具备可微性,可围绕最终任务目标进行整体优化。
- 端到端与模块化的差异在于是否将感知、预测、规划和控制拆分成多个人工定义模块。模块化系统可解释、可调试,但信息容易在模块边界损失;端到端系统信息传递更完整,但可解释性、可控性和安全验证难度更高。
发展路径与属性
- 发展路径经历了学术奠基(如ALVINN、CTC、seq2seq)、产品催化(如NVIDIA DAVE-2、Wayve)和产业跟进(如UniAD、特斯拉FSD v12、中国厂商跟进)。
- 属性包括训练方法(整体可微、梯度全局回传的联合优化)、系统架构(以单一或级联神经网络替代感知、预测、规划模块化流水线)和技术思想(让数据学习中间表征,而非人工先验显式定义全部接口)。
技术原理与对比
- 端到端的技术内核是全局可微与数据驱动,以最终驾驶任务的损失函数统一驱动参数更新,训练梯度由输出端回传至输入端,内部表征由数据自动习得。
- 与模块化对比,端到端的信息传递更完整,但模块化分工清晰、单点故障可定位。
一段式与二段式
- 一段式与二段式的差异在于信息处理环节数量,以及中间表征是否显式保留。一段式信息传递更完整、延迟更低,但可解释性和调试难度相应上升;两段式保留中间结果,有利于系统透明度、问题定位和决策逻辑调试。
- 端到端替代主决策回路规则,但规则并未完全消失,而是更多转向安全兜底、形式化校验、冗余备份和合规约束。特斯拉FSD v12以神经网络替代大量手写C++规则,是该趋势的重要标志。
应用进展
- 自动驾驶:特斯拉率先推动端到端量产,中国厂商2024年集中跟进,并在2025年前后进一步向VLA和世界模型演进。
- 机器人:自RT-2起即以VLA形态采用端到端。
- 数字AI:端到端已是默认范式,通常不再作为单独技术标签。
端到端与VLA
- VLA由谷歌DeepMind RT-2论文在2023年7月正式提出,将VLM纳入机器人控制,把动作表示为文本token并纳入同一训练集,形成视觉、语言、动作统一建模的范式。
- VLA与端到端的关系:VLA满足端到端的主要定义要素,属于端到端的子类与延伸,是端到端在多模态推理与动作生成方向上的升级。
端到端与世界模型
- 端到端与世界模型分别对应动作映射和环境建模,属于不同维度。端到端负责动作生成,世界模型负责环境预测,两者可以在同一系统中组合。
- 功能分工:端到端解决在当前观测下如何输出规划或控制;世界模型解决未来场景如何变化,以及模型如何在仿真环境中低成本获得训练信号。
研究结论
- 端到端普及是主决策范式从人工规则转向数据驱动模型,而非规则系统消失。
- 物理AI将成为物理世界的AI解决方案,智能驾驶作为最先跑通闭环的代表场景,应重点关注。