AI系列深度09期:从LLM到VLM再到VLA意味着什么?
核心观点与概念界定
LLM(大语言模型)、VLM(视觉语言模型)和VLA(视觉语言动作模型)代表大模型能力从文本处理、视觉理解到物理行动的递进。三者存在继承关系,但核心机制各异:
- LLM:以文本为输入输出,解决语言理解、生成和推理,核心机制为自回归预训练与Transformer架构。
- VLM:在语言底座上加入视觉理解,使图像和文字在同一语义空间交互,核心机制为视觉编码、模态对齐与语言推理。
- VLA:进一步把动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中行动,核心机制为动作表征、连续生成与系统分工。
技术脉络与演进路径
数据与表征难度逐级抬升
- LLM:依赖文本语料,通过海量文本和自监督训练形成语言基础模型。
- VLM:增加图文对齐、视觉编码器和模态投影,难度高于LLM。
- VLA:需要机器人示教、遥操作轨迹、动作反馈和真实环境数据,难度最高,动作输出会改变物理世界。
应用边界与场景
- LLM:主要处理知识、代码、对话和软件任务。
- VLM:扩展到图像理解、图文问答、视觉检索和多模态交互。
- VLA:进入机器人、自动驾驶和具身执行,需处理实时性、安全性和物理反馈。
代表性模型与公司
- LLM:GPT系列、BERT系列、InstructGPT等,公司包括OpenAI、Google、Meta等。
- VLM:CLIP、Flamingo、BLIP-2、LLaVA、GPT-4V等,公司包括Google、Physical Intelligence、NVIDIA等。
- VLA:RT-2、π0、NVIDIA GR00T N1、智元GO-1等,公司包括Google、Physical Intelligence、NVIDIA、Figure等。
产业映射与竞争格局
- 海外:OpenAI、Google、Meta、Anthropic等主导LLM/VLM,Google、Physical Intelligence、NVIDIA、Figure等布局VLA和机器人。
- 国内:DeepSeek、阿里、字节、百度、腾讯、智谱等布局LLM/VLM,智元、银河通用等聚焦VLA与机器人本体。
- 竞争核心:从模型能力延伸到数据、硬件、动作控制与场景闭环。
研究结论
- 数字AI底座模型发展路径清晰,但难以实现物理世界的建模闭环。
- 物理AI将成为物理世界的AI解决方案,智能驾驶作为最先跑通闭环的代表场景,应重点关注。
风险提示
- 技术迭代不及预期的风险。
- 大模型厂商ARR增速放缓的风险。
- 云服务商资本开支不及预期的风险。
- 智能驾驶及机器人商业化落地不及预期的风险。