Gemini Robotics 2 发布说明 / 新功能

Google DeepMind 发布了 Gemini Robotics 2,这是一个智能层,旨在让机器人超越预编程序列,迈向可适应的通用物理 AI。此更新为人形机器人引入了全身控制,为各种末端执行器引入了高精度灵巧性,并引入了用于复杂多步骤任务执行的代理推理。

Gemini Robotics 2 模型套件

Gemini Robotics 2 由三个专门的模型组成,这些模型负责处理机器人智能的不同方面,从高层规划到底层运动控制:

  • Gemini Robotics 2 (VLA): 一个视觉-语言-动作模型,直接将视觉和语言输入转换为运动控制。它支持完整的人形机器人和双臂机器人,提供从“脚到指尖”的控制。
  • Gemini Robotics ER 2 (Embodied Reasoning): 一个视觉-语言模型(VLM),充当代理的高级大脑。它管理人类交流、物理世界理解以及持续数分钟的多步骤任务规划。
  • Gemini Robotics On-Device 2 (VLA): 一个经过本地执行优化以消除网络延迟的高效 VLA 模型。它具备快速适应能力,使其能够在仅用几小时数据的情况下部署到新的机器人具现体上。

全身控制和人形运动

Gemini Robotics 2 将物理 AI 从上半身桌面任务扩展到全身协调。这使得人形机器人能够在为人类构建的环境中导航和操作物体,需要诸如行走、蹲下和伸展等动作。

在使用 Apptronik Apollo 2 人形机器人的演示中,模型成功处理了将浇水罐从桌子移到底层架子特定箱子的指令,这要求机器人行走、抓取物体并精确放置。

手部和夹具的高级灵巧性

该系统在不同类型的硬件末端执行器上引入了改进的精细度:

  • 多指手: 在 Apollo 2 上使用 22 自由度的 SharpaWave 手,模型可以执行诸如封口拉链袋或打结等精细任务。
  • 平行夹具: 在 Franka Duo 平台上,模型使用标准两指夹具实现诸如紧密包装等复杂灵巧任务。

代理推理和多机器人协作

Gemini Robotics ER 2 使机器人能够执行涉及数百个决策、持续数分钟的更长任务序列。该模型现在能够更好地识别任务何时开始和结束,并在执行过程中定位关键事件。

主要功能包括:

  • 自纠正: 推理模型使机器人能够泛化到新情况,并在序列中特定步骤失败时进行自纠正。
  • 多机器人协作: 不同类型的机器人现在可以进行通信和协作,以解决单个机器人能力无法应对的复杂工作流。

设备端适应和运动传递

Gemini Robotics On-Device 2 使用“运动传递”技术快速适应新的机器人硬件。该模型可以使用通常少于 200 个示例和几小时的适应时间,适应新的双臂机器人具现体——即使这些具现体具有显著不同的传感器、形状和自由度。这一点已在 Dexmate、SO101 和 Trossen 平台上得到验证。

安全框架和 ASIMOV-Agentic

Google DeepMind 已实施一种多层次的安全方法,将物理安全措施与 AI 安全框架相结合。

为了评估这些系统,他们引入了 ASIMOV-Agentic,这是一个用于代理安全编排和不确定性解决的基准。该基准衡量:

  1. 具身推理代理拒绝来自 VLA 的不安全工具调用的能力。
  2. 预测任务是否可能的能力,并在不确定时主动请求人工干预。

据报道,Gemini Robotics ER 2 在人体接近基准和安全约束遵循方面是迄今为止最安全的机器人模型,具备在人类过于接近时触发安全工具调用并停止机器人的能力。

Sources