Gemini Robotics-ER 1.6 发布说明 / 新功能

Gemini Robotics-ER 1.6 发布说明 / 新功能

Google DeepMind 推出了 Gemini Robotics-ER 1.6,这是一款以推理为先的模型,旨在提升“具身推理”——机器人将数字智能与物理行动相结合的能力。此更新显著增强了空间推理、多视角理解和任务成功检测,使物理代理能够实现更高水平的自主性。

高层次推理与集成

Gemini Robotics-ER 1.6 充当机器人高层次推理引擎。它能够通过原生调用各种工具来执行复杂任务,包括:

  • Google Search: 用于检索外部信息。
  • Vision-Language-Action (VLA) models: 用于将推理转化为物理运动。
  • Third-party user-defined functions: 用于自定义机器人集成的第三方用户定义函数。

该模型在指向、计数和成功检测方面,相较于 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 展示了显著的性能提升。

通过指向进行空间推理

指向被用作空间推理的基础能力,使模型能够执行多项关键的机器人功能:

  • Precision Object Detection and Counting: 精确的目标检测与计数:在场景中识别并计数特定物体。
  • Relational Logic: 关系逻辑:定义“从‑到”关系(例如,将物体移动到特定位置),并进行比较,如识别集合中最小的物体。
  • Motion Reasoning: 运动推理:映射轨迹并确定最佳抓取点。
  • Constraint Compliance: 约束遵循:通过提示进行推理,例如“指向所有足够小以放入蓝色杯子的物体”。

Gemini Robotics-ER 1.6 将指向用作中间步骤,以执行数学运算,从而获得更好的度量估计并更准确地计数物体。在对比测试中,它在识别正确的工具数量以及避免出现图像中不存在的虚构物体方面,优于 Gemini Robotics-ER 1.5。

自主成功检测

成功检测使机器人能够判断任务是否已完成,从而决定是重试失败的尝试还是继续执行计划中的下一步。Gemini Robotics-ER 1.6 改进了多视角推理,这对于通过合成来自多个摄像头流(例如,将俯视摄像头与腕部摄像头的画面)信息来处理遮挡和弱光环境,以形成对环境的连贯理解至关重要。

通过主动视觉进行仪表读取

该功能由与 Boston Dynamics 合作开发,Gemini Robotics-ER 1.6 引入了读取复杂工业仪表的能力,例如圆形压力表、垂直水平指示器和数字显示屏。这对像 Spot 这样的设施检查机器人尤为有用。

为实现高精度,模型采用“主动视觉”,通过多步骤过程将视觉推理与代码执行相结合:

  1. 放大: 模型对图像进行放大,以捕捉仪表上的细小细节。
  2. 估算: 利用指向和代码执行来估计比例和间隔。
  3. 解释: 运用世界知识解释最终读数,包括单位和小数位。

“诸如仪表读取和更可靠的任务推理等能力将使 Spot 能够完全自主地观察、理解并应对现实世界的挑战。” — Marco da Silva,Boston Dynamics Spot 副总裁兼总经理

安全性与约束遵循

Gemini Robotics-ER 1.6 被描述为截至目前 Google DeepMind 最安全的机器人模型,在对抗性空间推理任务上更好地遵循了 Gemini 安全政策。

关键安全改进包括:

  • Physical Safety Constraints: 物理安全约束:更好地遵守诸如“不要处理液体”或“不要拾取重量超过 20kg 的物体”等约束。
  • Hazard Identification: 危害识别:在基于真实伤害报告的测试(Asimov 基准)中,模型在文本场景下比 Gemini 3.0 Flash 提高了 6%,在视频场景下提高了 10%,在准确感知受伤风险方面表现更佳。

可用性

开发者可通过 Gemini API 和 Google AI Studio 使用 Gemini Robotics-ER 1.6。Google 还提供了一个开发者 Colab 笔记本,内含配置模型以执行具身推理任务的示例。

Sources