AI系列深度09期:从LLM到VLM再到VLA意味着什么? 2026年07月31日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼LLM、VLM、VLA可理解为同一技术脉络上逐层扩展模态和输出能力的三类大模型。LLM以文本为输入输出,主要解决语言理解、生成和推理;VLM在语言底座上加入视觉理解,使图像和文字在同一语义空间交互;VLA进一步把动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中行动。三者存在继承关系,但不能简单归结为同一种next-token机制。 ◼从概念脉络看,LLM由Transformer、GPT等奠定,核心是以海量文本和自监督训练形成语言基础模型;VLM由CLIP、Flamingo等推动,通过图文对齐、视觉编码器和模态投影,把视觉信息接入语言模型;VLA由Google DeepMind在RT-2中明确命名,核心是把视觉、语言与动作统一到策略模型中。 相关研究 ◼从数据和表征看,三者难度逐级抬升。LLM训练依赖文本语料,VLM增加图文对和视觉编码,VLA则需要机器人示教、遥操作轨迹、动作反馈和真实环境数据。动作不是普通输入模态,而是会改变物理世界的控制输出;因此,VLA既可把动作离散化为token自回归生成,也可用扩散策略或流匹配生成连续动作轨迹。 《AI系 列 深 度08期 :GAN与Diffusion两类生成范式有何差异?》2026-07-31 《AI系列深度07期:CNN与ViT两类视觉骨干有何差异?》2026-07-30 ◼从应用边界看,LLM主要处理知识、代码、对话和软件任务;VLM把能力扩展到图像理解、图文问答、视觉检索和多模态交互;VLA则进入机器人、自动驾驶和具身执行,需要处理实时性、安全性和物理反馈。NVIDIA的慢思考VLM加快思考动作模型、π0的连续动作生成、RT-2的动作token化,均体现VLA内部路线仍在分化。 ◼产业映射上,海外OpenAI、Google、Meta、Anthropic等主导LLM/VLM,Google、Physical Intelligence、NVIDIA、Figure等布局VLA和机器人;国内DeepSeek、阿里、字节、百度、腾讯、智谱、月之暗面、MiniMax等布局LLM/VLM,智元、银河通用等聚焦VLA与机器人本体。后续竞争核心将从模型能力延伸到数据、硬件、动作控制与场景闭环。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1. LLM:以文本为核心的语言基础模型..............................................................................................41.1.概念界定与提出背景.................................................................................................................41.2.核心机制:自回归预训练与Transformer................................................................................41.3.能力边界与应用场景.................................................................................................................41.4.代表性模型与公司.....................................................................................................................42. VLM:视觉模态如何接入语言底座..................................................................................................52.1.概念界定与技术脉络.................................................................................................................52.2.核心机制:视觉编码、模态对齐与语言推理.........................................................................52.3.能力边界与应用场景.................................................................................................................62.4.代表性模型与公司.....................................................................................................................63. VLA:动作输出如何进入多模态模型...............................................................................................63.1.概念界定与提出背景.................................................................................................................63.2.核心机制:动作表征、连续生成与系统分工.........................................................................73.3.能力边界与应用场景.................................................................................................................83.4.代表性模型与公司.....................................................................................................................84. LLM、VLM、VLA关系:模态扩展与约束递进...........................................................................84.1.架构关系:从文本到视觉再到动作.........................................................................................84.2.问题与数据递进:从数字语料到真实动作轨迹.....................................................................94.3.演进时间线.................................................................................................................................94.4.中国厂商在三个层次的布局...................................................................................................105.风险提示............................................................................................................................................10 图表目录 表1:LLM代表性模型一览................................................................................................................5表2:VLM代表性模型一览................................................................................................................6表3:VLA代表性模型一览.................................................................................................................8表4:LLM、VLM、VLA多维对照...................................................................................................9表5:LLM–VLM–VLA关键演进时间线...........................................................................................9表6:中国主要厂商在LLM、VLM、VLA三个层次的布局.........................................................10 1.LLM:以文本为核心的语言基础模型 LLM、VLM和VLA代表大模型能力从文本处理、视觉理解到物理行动的递进。LLM以文本理解与生成为核心,VLM在语言底座上接入视觉模态,VLA进一步将动作作为输出,使模型进入机器人和自动驾驶等物理场景。 1.1.概念界定与提出背景 大语言模型通常指在海量文本上预训练、参数规模达到数十亿乃至上千亿的语言模型,当参数规模越过一定阈值后,模型性能提升,并可能出现小模型不具备的能力。斯坦福CRFM则将其归入基础模型范畴。 奠基性工作包括:Transformer架构提出完全基于注意力机制的网络结构;GPT-1确立“生成式预训练+微调”范式;BERT确立双向预训练。规模法则刻画了损失随模型、数据、算力的幂律关系,直接指导了大模型的设计。 1.2.核心机制:自回归预训练与Transformer LLM以自回归方式进行下一词元预测依托Transformer自注意力机制建模长程依赖,并依托Transformer自注意力机制建模长程依赖。训练流程通常包括无监督预训练、指令微调和基于人类反馈的强化学习(RLHF)。InstructGPT证明,1.3B参数的对齐模型在人类评测中可被偏好于175B参数的GPT-