登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
大模型及机器人算法-VLA技术分解
信息技术
2026-01-08
-
-
文梦维
VLM模型与VLA模型
VLA模型
被视为“全程可求导”的统一架构,而传统的E2E+VLM模型则被视为“非全程可求导”的双系统拼凑“全程可求导”。
VLM模型的核心问题在于其输出端是文本(Text),而非轨迹(Trajectory)。
VLA模型将两个并行的、解耦的系统(3D编码器->动作解码器和2D编码器->LLM),重构为一个统一的、串行的“V -> L -> A”单一模型(空间智能->语言智能->行动策略)。
VLA模型的通用技术栈
VLA模型包含三大核心组件:视觉编码器(Visual Encoder)、大型语言模型(Large Language Model,即L模块)和动作解码器(Action Decoder)。
视觉编码器(V)主要有两种:CLIP/SigLIP和DINOv2。CLIP/SigLIP提供“内容识别”能力,而DINOv2提供“空间理解”能力。
顶尖方案通常采用SigLIP+ DINOv2双编码器策略,将两者的特征融合后,再送入MLP Projector,最终形成综合性的视觉表示。
理想汽车MindVLA:V/L/A三位一体的重构
MindVLA的V模块采用3D高斯建模(3D Gaussian Splatting, 3DGS),直接进行高保真的3D场景重建,为“从零预训练”的L模块提供更原生、更丰富的3D空间输入。
MindVLA的L模块采用自研模型MindGPT,专为3D驾驶场景设计,具有原生3D输入、面向驾驶的预训练、为车端优化的架构和高效动作输出等特点。
MindVLA的A模块采用基于扩散的Transformer,生成精细化、拟人化的驾驶轨迹,并实现从“反应”到“博弈”的集体建模。
VLA的进化阶段
VLA经历了四个进化阶段:驾驶解释器、模块化VLA模型、推理增强的VLA模型和推理VLM与工具使用代理。
随着进化,VLA模型逐渐从简单的指令执行,发展到具备推理、规划和多智能体交互的能力。
理想MindVLA:V/L/A三位一体的重构
MindVLA的V模块采用3D高斯建模(3D Gaussian Splatting, 3DGS),直接进行高保真的3D场景重建,为“从零预训练”的L模块提供更原生、更丰富的3D空间输入。
MindVLA的L模块采用自研模型MindGPT,专为3D驾驶场景设计,具有原生3D输入、面向驾驶的预训练、为车端优化的架构和高效动作输出等特点。
MindVLA的A模块采用基于扩散的Transformer,生成精细化、拟人化的驾驶轨迹,并实现从“反应”到“博弈”的集体建模。
小米/华科ORION:用“规划Token”弥合“语义鸿沟”
ORION是一个“通过视觉语言指令指导轨迹生成的端到端自动驾驶框架”。
ORION的核心创新在于:它并不强迫VLM(L模块)去直接生成那些它不擅长的、高精度的轨迹数值。
ORION的VLM(L模块)只负责“思考”,输出一个高度凝练、抽象的“规划Token”(Planning Token)。
ORION的A模块(生成模型)只负责“执行”,接收L模块传来的“规划Token”,并生成最终的、高精度的、多模态的驾驶轨迹。
世界模型(World Model)与RLHF(人类反馈强化学习)
VLA的“智商”是靠数据“喂”出来的,更多的驾驶数据能线性地、可预地提升智驾性能。
高质量的(视觉+语言+行动)三模态对齐的数据是“极其稀缺且昂贵”的。
RLHF是VLA的“价值观校准器”,将VLA的行为,对齐到人类真正“偏好”的价值观上,例如“安全”、“舒适”、“合规”。
MindVLA的“世界模型中的强化学习”通过“渐进式场景重建”学习物理因果律,通过“新视角重建”提升真实感,最终为强化学习提供了一个安全、高效、可加速的“无限训练场”。
VLA带来的“物理智能体”新范式
VLA带来了“物理智能体”新范式,具备思维能力、沟通能力、记忆能力和自主学习能力。
VLA大规模落地的四大挑战:算力之墙、数据之渴、安全之问和感知之差。
总结
VLA通过V、L、A三个模块的彻底革命,已经构建了一个能看懂3D世界、能思考、能生成完美动作的“统一大脑”。
VLA的发展将走向何方?基础驾驶(物理)大模型、神经-符号安全内核、标准化交通(交互)语言。
你可能感兴趣
【机构龙虎榜解读】多模态+AI大模型+机器人,自主研发深度学习人脸识别算法,在视觉图像识别及人机智能交互方面拥有产业链关键技术,并于去年开始在双足和四足机器人方向展开技术探索,机构大额净买入这家公司
未知机构
2023-12-13
机器人VLA核心算法专家
未知机构
2025-05-26
汽车行业周报:Figure发布VLA大模型HeHelix,尊界S800首发六大智能化技术
交运设备
华鑫证券
2025-02-23
小鹏发布第二代VLA大模型,潍柴动力签定SOFC技术协议
交运设备
开源证券
2025-11-08
【公告全知道】Sora AI视频+机器人+华为鸿蒙+AIGC+信创!公司财税大模型算法应用于对话生成场景支持多端使用
未知机构
2024-02-22
【公告全知道】机器人+AI算法+云计算+多模态大模型+机器视觉+大数据!公司布局机器人产品
未知机构
2023-07-04
OptimusV2.5亮相股东大会,小鹏发布新一代Iron机器人及VLA模型
交运设备
华鑫证券
2025-11-10
小米-张俊博-声音技术的未来——大模型带来的音频算法革新
信息技术
2023第十二届全球TOP100软件案例研究峰会
2024-08-21
小鹏汽车科技日要点速览国信汽车第二代VLA大模型以视
未知机构
2025-11-05
2025科技日:第二代VLA大模型发布,三大具身智能全面升级推进
交银国际
2025-11-06