事件:Google DeepMind昨晚(7月30)发布Gemini Robotics 2等3个新一代具身智能Vla模型 三个模型 Gemini Robotics 2:我们最先进的VLA,这个模型有能力控制完整的人形机器人,从脚掌到指尖,也能控制其他双臂机器人,同时在双手和夹爪两类末端执行器上带来了新层级的灵巧操作能力。 Gemini Robotics ER 2:我们能力最强的具身推理(ER)模型。它是一个视觉语言模型(VLM),扮演我们的智能体角色,让机器人能够与人沟通、理解物理世界并规划长达数分钟的多步任务。我们也在其中引入了让机器人作为团队协同工作的能力。 Gemini Robotics On-Device 2: 我们效率最高的视觉语言动作模型(VLA),经过优化后可以在机器人设备本地运行。这个模型现在能够用几个小时的数据快速适配到全新的机器人本体上。 本次模型解锁的技能: #首次解锁全身控制:Gemini Robotics 2把物理AI从此前的上半身桌面任务扩展到了全身动作,比如可以完成“把洒水壶放进最下层货架的绿色箱子里”,是迈向更复杂真实任务所需技能的重要一步。 #解决了精细化操作和跨本体迁移:Gemini Robotics 2在不同末端执行器上都解锁了新层级的物理灵巧度,无论机器人用的是手还是夹爪,都比以往更加有用。这个模型现在可以 控制Apollo 2机器人上那只五指、22个自由度的SharpaWave手,完成打结或者封住保鲜袋这类精细动作。 我们正在继续推进精度和速度,目标是达到人类水平的灵巧度。我们的具身推理模型Gemini Robotics ER 2充当机器人的高层大脑,负责处理用户指令并与人沟通,它推理出完成任务所需的步骤,与VLA协同来执行动作,并且一路跟踪进度直到任务完成。#这套配置让机器人能够执行复杂的多步任务(本次更新任务序列持续时间长达数分钟涉及数百个决策)、并泛化到全新的情境和目标上。Gemini Robotics ER 2现在能理解任务何时开始、何时结束,也能精确定位关键事件发生的时刻,这在进度理解上是一次台阶式的变化。 解锁多机器人协作。让不同类型的机器人可以互相沟通、协同工作,去解决单台机器人独自无法完成的复杂工作流。 附原文连接:知识星球-安全中心