核心观点
RoboBrain 2.0 是 BAAI 团队开发的最新一代具身视觉语言基础模型,旨在统一物理环境中复杂具身任务的感知、推理和规划。该模型采用异构架构,包含视觉编码器和语言模型,并支持轻量级 7B 模型和全尺寸 32B 模型两种变体。
关键数据
- 性能表现: 在空间和时序推理基准测试中,32B 变体均取得领先结果,超越了开源和闭源模型。
- 能力支持: 支持空间理解(如可供性预测、空间指代、轨迹预测)和时序决策(如闭环交互、多智能体长时程规划、场景图更新)等关键具身 AI 能力。
- 数据规模: 训练数据涵盖通用多模态理解、空间感知和时序建模,包括 873K 高质量样本的通用 MLLM VQA 数据集,以及支持空间理解、时序推理和因果推理的 152K 高分辨率图像、86K 对象指代数据、561K 可供性数据、826K 空间理解数据、802K 空间指代数据、50K 闭环交互数据等。
研究结论
- 模型架构: 采用模块化编码器-解码器架构,统一感知、推理和规划,支持多视图图像、视频和高分辨率视觉输入,以及复杂任务指令和结构化场景图。
- 训练策略: 采用三阶段渐进式训练策略,包括基础时空学习、具身时空增强和具身环境中的思维链推理,以支持空间理解、时序建模和长链因果推理。
- 基础设施: 开发了 FlagScale 框架,集成了混合并行、内存预分配、高吞吐量 I/O 管道和鲁棒容错机制,以提高训练和部署效率。
- 评估结果: 在超过 12 个公共基准测试中评估了 RoboBrain 2.0 的性能,在 6 个基准测试中取得了最先进的结果,展现出强大的空间推理、时序反馈和具身规划能力。
未来工作
- 具身 VLM 驱动的 VLA: 将具身 VLM 集成到视觉语言行动 (VLA) 框架中,以增强行动生成的通用性和鲁棒性。
- 系统级集成: 与先进的机器人平台和操作系统进行紧密集成,以实现服务器less 部署、无适配技能注册和低延迟实时控制,并构建协作具身 AI 生态系统。