东吴汽车AI系列深度25期:自动驾驶AI范式的跃迁分析发布时间:2026-08-16一、核心要点1. 自动驾驶领域中,强化学习是突破模型能力上限的关键环节,与大语言模型中作为配角的定位不同2. 大语言模型依赖互联网级人类语料构建高起点,强化学习仅用于事后对齐与推理增强;自动驾驶模仿人类驾驶数据,上限受限于平均人类水平,需强化学习实现超越人类安全目标3. 自动驾驶模仿学习存在协变量漂移、长尾场景缺失等结构性缺陷,无法通过增加模仿数据解决,必须依赖强化学习突破边界二、投资线索1. 强化学习与世界模型是自动驾驶落地的核心工程方向,理想、华为等厂商均将世界模型作为强化学习的训练载体2. 量产路线中,特斯拉、小鹏、理想等已推进强化学习应用,小鹏72B模型已积累2000万次视频训练数据3. 供应商阵营中,Momenta、地平线等均在端到端模型中引入强化学习技术4. L4阵营侧重安全冗余,小马智行以超百亿级仿真测试里程开展强化学习训练三、风险与关注1. 强化学习在自动驾驶中的应用依赖高保真世界模型,存在环境逼真度不足的风险2. 产业呈现分化格局,技术落地节奏存在不确定性