我们在0718的WAIC见闻(上)中重点提到#“跨本体+长任务”是具身模型泛化性的较高评判标准,近期包括0723发布的GEN-1(针对灵巧手的“跨本体”)、0727发布的智元0-τVLA(针对“长任务”)纷纷印证产业朝着这两大趋势发展,而0730发布的Gemini Robotics2进一步强化了“跨本体+长任务”这两大方向。另外,我们在上周周报提到的#“分层架构”思想在Gemini Robotics 2亦有显著体现。 结合个人理解,简单阐述DeepMind三个模型在模型架构和模型能力的亮点: 🥇模型架构:分层。虽有3个模型,但仍然是两层架构,分别是Gemini Robotics ER 2负责高层语义子任务,Gemini Robotics 2负责低层连续动作生成。从结果来看,分层结构对下面两大能力有重要影响。 🥈模型能力:跨本体+长任务。 #跨本体。博客提到,在无需微调的情况下,模型能驱动2个本体和3个灵巧手操作。 要实现跨本体,最重要是完成对不同本体和灵巧手数据的动作空间对齐,将这些数据放在放在同一架构中共同建模,比如阿里近期发布的Qwen-RobotManip,实际上就是设计了设计80维的通用动作模版,让不同数据全部映射至同一表征空间。(这一思想和能力亦在蚂蚁、智元、星海图等模型中出现,差别实际上要看最终跨本体的成功率) #长任务。博客提到,机器人能够更可靠地执行数分钟以及数百个决策的长任务序列,且能精确定位关键事件发生的时刻。 这一长任务的能力本质是就是来自分层架构。从原理来看,实际上是将复杂任务拆分为多个小任务,能让机器人在长时间内跟踪各个小任务的进度,同时依靠上层的抽象记忆完成对单个小任务失败后的快速恢复。(这一思想和能力在pi0.5、Gemini Robotics 1.5、0-τVLA等均有体现,差别实际上要看最终长任务的成功率) ‼️简而言之,结合我们在上述举例提到的其他顶级具身模型,可以发现,Gemini Robotics2从架构和能力来看,沿用了产业聚焦的几大前沿方向,从影响意义来看,我认为这实际上代表着#行业顶级玩家在“通用具身模型”奠定了技术路线收敛的基调。