强化学习成为高物理闭环任务关键环节
数字AI与物理AI中模仿学习的差异
- 数字AI(大语言模型):模仿学习对象为互联网级人类文本语料,知识覆盖广,能力底座高,强化学习主要承担后训练、偏好对齐与推理增强角色。
- 物理AI(自动驾驶):模仿学习对象为人类驾驶轨迹,受限于人类驾驶水平且存在协变量漂移问题,难以达到L4安全目标,强化学习成为突破上限的关键环节。
模仿学习的结构性缺陷
- 协变量漂移:行为克隆在训练分布外表现不稳定,误差累积导致策略失效。
- 行为筛选局限:模仿学习难以区分被模仿行为的优劣,强化学习可通过奖惩信号提供行为筛选机制。
强化学习与世界模型的共生关系
- 真实道路的局限性:无法承担反复试错、失败重置和危险事件注入,世界模型成为强化学习的闭环试错场。
- 双向校准:真实数据校准世界模型保真度,强化学习结果反哺世界模型迭代。
- 主流工程取向:生成式与重建式世界模型结合,构建高保真仿真环境。
厂商实践路线
- 量产乘用车辅助驾驶:
- 共识:端到端模型之上叠加强化学习后训练。
- 代表性厂商:特斯拉、小鹏、理想、Momenta、地平线、千里科技、卓驭、元戎启行等。
- 路线分化:
- VLA路线:小鹏、理想、元戎、千里浩瀚G-ASD等。
- 弱化语言中介:华为、地平线、Momenta等。
- L4 Robotaxi:
- 核心关注:大规模闭环仿真、安全冗余、超越人类驾驶水平。
- 代表性厂商:小马智行(PonyWorld)、Waymo、文远知行等。
- 技术侧重:基础模型、大规模仿真、端到端能力建设。
研究结论
- 强化学习角色转变:从可选增强转向突破模仿上限的关键环节。
- 工程共生:世界模型与强化学习绑定,形成数据生成、仿真训练与闭环评估的共用基础设施。
- 产业格局:多数厂商围绕“端到端+世界模型仿真+强化学习”方向演进,但在语言中介、强化学习披露程度和落地形态上存在分化。
风险提示
- 技术迭代不及预期。
- 大模型厂商ARR增速放缓。
- 云服务商资本开支不及预期。
- 智能驾驶及机器人商业化落地不及预期。