本次内容聚焦自动驾驶领域VLA相关分析,核心结论为VLA的价值在于用动作头补上视觉语言模型留下的动作生成缺口,头部厂商围绕是否保留显式语言推理层出现路线分化:小鹏第二代VLA去掉显式语言中间层,以隐式表征与视觉CoT直接出动作;理想MindVLA保留语言层,动作侧采用扩散头;元戎40BVLA基座实现Driver/Analyst/Critic三角色共享同一底座;千里KoVLA将思维链从文本空间搬至隐空间;WaymoEMMA基于Gemini搭建,以语言为万能中间格式、纯视觉不含激光雷达。VLA是自动驾驶范式演进的第四阶段,落地面临鲁棒性、不低于30赫兹的车端推理帧率要求、算力、三模态对齐数据稀缺等