核心观点与关键数据
- 缩放定律与车端约束:经典缩放定律主要关注训练最优,未考虑推理成本与时延。车端部署需将推理成本纳入目标,导致部署模型更倾向于“更小模型、更多训练数据”。智能驾驶进一步强化此约束,要求在固定车规算力上满足帧率、端到端时延和功能安全要求。
- 车端实时性挑战:大型视觉Transformer叠加大语言模型难以在现有车规算力(如NVIDIA Orin-X、Thor-U)下满足高频推理要求。理想VLA推理帧率约10Hz,Waymo端到端推理时延99ms,小鹏第二代VLA指令输出时延压缩至80ms以内。
- 云端效率优化路径:
- 通用模型稀疏化与注意力优化:包括MoE、MLA、线性注意力、FP8、投机解码等,降低模型容量和推理算力。
- 面向驾驶的Token剪枝:如理想LightVLA、小鹏FastDriveVLA,减少视觉Token冗余,降低计算量与时延。
- 思维链压缩:如FutureX、DynVLA,用动态/隐式Token替代冗长思维链,缩短串行计算时延。
- 世界模型/仿真加速:如小鹏X-Cache,通过特征缓存复用加速训练与仿真侧的世界模型推理。
- 车端部署优化路径:
- 云端大模型蒸馏上车:Waymo、小鹏、理想均采用此方法,将高容量云端教师模型蒸馏为紧凑的学生模型部署上车。例如,理想将约32B云端基座蒸馏为约4B车端VLA。
- 快慢双系统:理想早期采用端到端+VLM双系统,Waymo采用Think Fast/Slow架构,将快速直觉反应与慢速复杂推理分离,兼顾时延与长尾能力。
- 推理工程手段:包括量化(INT4、INT8、FP8)、并行/投机解码、采样步数压缩(如理想将去噪步数压缩至2步)、编译优化等,进一步降低端到端时延。
- 云车分工趋势:未来趋于“云端探上限、车端保实时”。云端模型负责更大规模、更复杂推理和世界模型训练,车端模型则围绕低时延、稳定性和安全冗余做压缩部署。
研究结论
- 数字AI底座模型发展路径已逐渐清晰,价值在于确定性,但其难以实现物理世界的建模闭环。
- 物理AI(如智能驾驶)将成为物理世界的AI解决方案,在AI当前发展阶段成为增量更大的方向。智能驾驶作为最先跑通闭环的代表场景,应重点关注。
风险提示
- 技术迭代不及预期的风险。
- 大模型厂商ARR增速放缓的风险。
- 云服务商资本开支不及预期的风险。
- 智能驾驶及机器人商业化落地不及预期的风险。