目前全球VLA(视觉-语言-动作)机器人大模型已经形成了多路线探索、多主体参与的发展格局,不同区域也走出了差异化的发展路径,整体情况可以从技术路线、代表性成果、产业特征几个维度梳理:
一、主流技术路线
当前产业界的VLA模型主要分为三类技术方向:
- 单系统端到端架构:在统一模型内直接完成感知、决策和动作生成,比如智元机器人的GO-112模型,部署后可胜任擦桌子、倒水等真实家庭场景任务 【5】 。
- 双系统分层架构:是当下产业界的主流选择,采用异构模块分工的“大小脑”模式,用大模型负责认知推理、小模型负责实时运动控制,兼顾认知能力和响应速度,典型如Figure Helix模型,可实现7-9赫兹认知推理和200赫兹本体运控协同,完成物流分拣、叠毛巾、洗碗等现实作业 【3】 【5】 。
- 融合世界模型的增强路线:通过世界模型生成未来视觉观察结果、提前模拟感知到决策的全流程,进一步提升模型在未见环境中的泛化性,比如英伟达的DreamGen、智元的EnerVerse-AC15框架都属于这类探索方向 【5】 。
二、全球代表性VLA模型成果
目前海内外科技企业、机器人厂商都已经推出了多款落地性较强的VLA模型:
- 国内厂商:包括开源通用VLA模型UnifoLM-VLA-0,仅用单一策略就能在真实物理环境中完成12类不同操作任务 【2】 ;银河通用的GraspVLA是全球首个完全依靠合成数据预训练的VLA大模型 【4】 ;蚂蚁灵波科技开源的LingBot-VLA用9种双臂机器人平台的2万小时真实操作数据预训练,跨任务泛化成功率比行业基准Π0.5高出9.92个百分点 【8】 ;小鹏的IRON人形机器人搭载VLA大模型已经在广州工厂投入实训,实现从动作模仿到认知决策的能力升级 【12】 。
- 海外厂商:英伟达的ISAACGR00TN1模型在GPU训练时长维度处于行业领先位置,其开放人形机器人基础模型也被波士顿动力等机器人企业采用开发相关产品 【6】 【7】 ;Figure AI的Helix模型通过视觉和自然语言提示训练,让人形机器人具备深度理解真实场景、精细运动控制的能力 【7】 ;谷歌也推出了GeminiRobotics机器人VLA模型,同时搭建了Open-X EmbodiedDatasets大规模真实具身数据集支撑模型训练 【6】 【9】 。
三、全球不同区域的产业发展特征
不同地区的VLA大模型发展路径差异明显:
- 中国:侧重场景闭环+数据迭代,走工程化落地、场景适配、成本可控的路线,依托国内爆发式增长的具身智能市场和全链路产业链潜力,快速推进VLA模型的商业化落地,但底层模型的原创性仍有提升空间 【13】 。
- 美国:以学术前沿探索+资本驱动为核心,主打模型通用性、端到端能力和多机器人协同特性,头部项目可获得单轮数亿美元的大额市场化融资,掌握核心技术优势,但规模化落地能力相对受限,整体部署成本偏高,依赖高端GPU集群支撑 【13】 。
- 日本:依托自身在伺服电机、减速器等核心零部件的精密制造护城河发展VLA相关机器人,硬件实力强劲,但软件和系统集成环节存在明显短板,产业资本是主要的研发推动力量 【13】 。
- 欧盟:以顶级科研联盟开源协作为核心,通过ISO、IEC等国际标准组织推动机器人安全、互操作性标准制定,抢占行业话语权,不过本地风险资本对AI和机器人领域的支持规模有限,技术研发向商业化转化的效率偏低 【13】 。
四、当前行业共性发展现状
目前VLA模型的参数规模普遍集中在5亿到70亿区间,已经初步具备让机器人自主学习、感知、行动的基础能力,行业普遍认为高质量物理交互数据是当前模型性能的核心瓶颈,仿真数据、公开视频数据、真实交互数据三类结合的训练路径是未来的主流方向,同时行业也预判长期来看只有少数具备规模优势的模型提供商能够持续存活 【6】 【7】 【8】 。