这份研报深入探讨了云端基座模型如何在车端实现毫秒级推理的挑战与解决方案。报告分析了经典缩放定律在车端部署的局限性,指出车端实时性要求导致模型更倾向于“更小模型、更多训练数据”的部署策略。同时,报告详细介绍了车端实时性挑战,如大型视觉Transformer叠加大语言模型难以在现有车规算力下满足高频推理要求,并以理想、Waymo、小鹏等企业的具体实践为例,阐述了云端效率优化路径(如通用模型稀疏化、Token剪枝、思维链压缩等)和车端部署优化路径(如云端大模型蒸馏、快慢双系统、推理工程手段等)。此外,报告还展望了云车分工趋势,认为未来将趋于“云端探上限、车端保实时”,云端模型负责更大规模、更复杂推理,车端模型则围绕低时延、稳定性和安全冗余做压缩部署。
AI在汽车行业的赛道发展趋势呈现云车协同、实时性优先的特点。云端模型持续向更大规模、更复杂推理发展,以支撑世界模型训练和深度理解能力提升;车端模型则聚焦于低时延、稳定性和安全冗余,通过模型压缩、推理优化等手段满足车规级要求。智能驾驶作为最先跑通闭环的代表场景,将成为AI在物理世界应用的主要增量方向。未来,云车分工将更加明确,云端负责探索上限,车端保障实时响应,两者协同推动智能驾驶技术落地。这一趋势要求企业具备云端大模型训练能力和车端推理优化技术,以应对不同场景的AI需求。
报告重点分析了云端基座模型在车端部署的效率优化路径和实时性挑战。在效率优化方面,报告系统梳理了多种技术手段,包括通用模型稀疏化与注意力优化(如MoE、MLA、线性注意力、FP8、投机解码等)、面向驾驶的Token剪枝(如理想LightVLA、小鹏FastDriveVLA)、思维链压缩(如FutureX、DynVLA)以及世界模型/仿真加速(如小鹏X-Cache)。在实时性挑战方面,报告详细剖析了大型视觉Transformer叠加大语言模型在现有车规算力(如NVIDIA Orin-X、Thor-U)下的局限性,并以理想、Waymo、小鹏等企业的实践为例,阐述了云端大模型蒸馏上车、快慢双系统以及推理工程手段(如量化、并行/投机解码、采样步数压缩等)如何降低端到端时延。此外,报告还探讨了云车分工趋势,认为未来将趋于“云端探上限、车端保实时”。
当前智能驾驶市场呈现技术快速迭代、企业加速布局的特点。一方面,云端模型规模持续扩大,算力需求不断提升,推动AI技术在深度理解和复杂推理能力上取得突破;另一方面,车端实时性要求促使企业积极探索模型压缩和推理优化技术,以满足车规级部署需求。理想、Waymo、小鹏等领先企业已通过云端大模型蒸馏、快慢双系统等方案,初步实现了毫秒级车端推理。同时,智能驾驶作为最先跑通闭环的代表场景,正成为AI在物理世界应用的主要增量方向,吸引大量资本和人才投入。然而,技术迭代、大模型厂商ARR增速、云服务商资本开支以及商业化落地等方面仍存在不确定性,市场发展仍需克服诸多挑战。
这份研报提示了四方面主要风险:一是技术迭代不及预期的风险,AI技术在车端部署的效率优化和实时性提升仍面临技术瓶颈,若关键技术研发受阻,可能影响智能驾驶落地进程;二是大模型厂商ARR增速放缓的风险,云端大模型训练成本高昂,若厂商ARR增速放缓,可能影响对智能驾驶技术的持续投入;三是云服务商资本开支不及预期的风险,云服务商是智能驾驶技术发展的重要支撑力量,若资本开支不及预期,可能影响云端算力供给;四是智能驾驶及机器人商业化落地不及预期的风险,智能驾驶技术的商业化落地仍需克服成本、安全、法规等多重障碍,若商业化进程缓慢,可能影响产业链整体发展。