从你提供的参考资料中,不同企业/机构的具身智能模型相关信息整理如下,覆盖主流厂商的自研产品、技术特点与布局方向:
一、头部科技/具身智能企业自研具身大模型
- 银河通用:先后推出GraspVLA(2025年1月发布,以大规模仿真及合成数据预训练+少量真实机器人数据后训练,聚焦抓取与泛操作) 【1】 ,以及全球首个人形机器人通用小脑GPT基础模型AstraBrain-WBC0.5 【15】 。
- 小鹏汽车:2025年11月发布第二代VLA大模型,属于世界大模型/VLA类型,融合视觉理解、语言推理与动作生成,面向汽车与机器人等物理世界智能体 【1】 。
- Figure AI:2026年1月发布Helix 02全身VLA模型,可将视觉输入直接映射至全身动作,统一控制手、臂、躯干及双腿,支持长任务链和全身协操作 【1】 。
- 小米:2026年2月发布47亿参数的Xiaomi-Robotics-0 VLA模型,使用跨本体机器人轨迹及视觉语言数据预训练,主打实时推理与跨本体泛化;同时自研MiLM大模型、全身控制算法(Mi-Sense视觉空间系统),支撑旗下CyberOne、CyberDog系列机器人的情感感知与人机交互能力 【1】 【13】 。
- 谷歌DeepMind:2026年4月发布Gemini Robotics-ER 1.6 VLM/具身推理模型,强化空间推理、多视角理解与复杂任务规划,承担机器人高层推理与决策工作 【1】 。
- 英伟达:2026年4月发布GROOT N1.7 VLA模型,基于双臂、半人形及大规模人形机器人数据训练,支持跨本体迁移与通用操作;更早还推出过GROOT视觉-动作模型,通过视频-语言-动作数据训练,实现自然语言指令到机器人动作的直接映射,主打实时推理与硬件加速 【1】 【7】 。
- Physical Intelligence:2026年4月发布Tt0.7机器人基础模型/VLA,强调通用化与可引导性,可根据新语言指令执行训练数据中未出现的任务;此前还推出过T0机器人控制模型,专注低延迟动作生成与环境感知,适配家庭服务机器人实时交互与动态避障需求 【1】 【7】 。
- 阿里巴巴:2026年6月发布千问具身智能大模型Qwen-Robot系列,包含VLA操作模型、VLN移动模型、Qwen-RobotWorld世界模型三大模块 【15】 。
- 智元机器人:推出Genie Operator-1多模态决策模型,可通过自然语言指令生成机器人动作序列,支持复杂场景下的任务规划与动态调整,适配服务机器人和工业场景;后续自研WorkGPT多模态大模型,搭配“云端超脑、主脑、子脑、脑干”认知架构,主打具身智能与任务编排能力 【7】 【13】 。
- 优必选:自研BrainNetAI系统(含云端SuperBrain和板载Smart Cerebellum),同时与DeepSeek等合作训练多模态大模型,实现感知、决策、控制一体化 【13】 。
- 傅利叶智能:与英伟达Project GR00T合作,自研强化学习、模仿学习、视觉-语言-运动(VLM)大模型算法,支撑旗下GR-1人形机器人运行 【13】 。
- 宇树科技:自研UnifoLM机器人语言大模型,整合AI深度学习、计算机视觉、语音识别技术,适配H1、G1等人形机器人产品 【13】 。
- 华为:推出盘古具身智能大模型,主打小样本学习与泛化操作能力,为夸父人形机器人提供技术赋能 【13】 。
二、其他特色具身智能相关模型
除了企业自研的商用模型,还有不少高校、科研机构联合开发的代表性模型,包括谷歌与柏林工业大学合作的PaLM-E、谷歌的RT-X、斯坦福李飞飞团队的VoxPoser、Meta与卡耐基梅隆大学联合的RoboAgent、斯坦福与谷歌合作的OpenVLA等,覆盖指令驱动动作生成、3D姿态生成、复杂任务分解等不同具身场景需求 【7】 。
三、面向垂域场景的具身集群模型
部分面向行业解决方案的企业,自研了集群智慧巡检系列垂域具身VLA大模型体系,搭配多模态大模型、行业大模型技术,通过多类型数据训练实现多模态感知、自主决策与可靠任务执行,适配能源油田、交通枢纽、工业园区等场景的具身机器人互联协同需求 【2】 【6】 。