Gemini Robotics 1.5 与 Gemini Robotics-ER 1.5 发布

Google DeepMind 已发布 Gemini Robotics 1.5 和 Gemini Robotics-ER 1.5,这两款专用模型旨在将 AI 代理从数字环境转移到物理世界。通过将认知负荷在高层规划和低层运动执行之间分配,这些模型使机器人能够感知、规划并行动,以更高的透明度和泛化能力解决复杂的多步骤任务。

代理框架:编排与执行

Google DeepMind 使用两模型代理框架来处理现实任务的复杂性,例如根据当地回收指南对物体进行分类。

Gemini Robotics-ER 1.5(具身推理)

Gemini Robotics-ER 1.5 充当系统的“高层大脑”。它是一个针对具身推理进行优化的视觉语言模型(VLM),负责编排机器人整体活动。其主要能力包括:

  • 规划与决策: 创建详细的多步骤计划以完成任务。
  • 工具集成: 原生调用数字工具,例如 Google Search,或第三方用户自定义函数,以获取所需信息。
  • 空间理解: 在空间理解基准测试中实现最先进的性能,包括指向、图像问答和视频问答。
  • 监控: 在任务执行过程中估计自身的成功率和进度。

Gemini Robotics 1.5(视觉语言动作)

Gemini Robotics 1.5 是一个视觉语言动作(VLA)模型,将 ER 模型提供的自然语言指令转换为直接的运动指令。不同于传统的 VLA 模型仅将计划翻译为动作,Gemini Robotics 1.5 “先思考后行动”,在自然语言中生成内部的推理与分析序列。这使得机器人能够:

  • 分解复杂任务: 将较长的任务拆分为更简单、更短的子任务,以实现更可靠的执行。
  • 提升透明度: 用自然语言解释其思考过程,使决策过程对用户可见。
  • 增强鲁棒性: 更好地泛化到新任务并适应环境变化。

跨具身学习与泛化

Gemini Robotics 1.5 解决了在形状、尺寸和自由度不同的机器人之间转移技能的挑战。该模型展示了跨具身学习的能力,即在一台机器人上学习的动作可以迁移到另一台机器人,而无需为每种新硬件配置进行模型专门化。

Google DeepMind 在多个平台上观察到此能力:在 ALOHA 2 机器人上训练的任务能够成功在 Apptronik Apollo 人形机器人和双臂 Franka 机器人上执行,反之亦然。

性能基准与安全

空间推理基准

Gemini Robotics-ER 1.5 在 15 项学术基准上进行评估,取得了最先进的综合性能。这些基准包括:

  • 具身推理问答(ERQA)
  • Point-Bench
  • RefSpatial、RoboSpatial-Pointing、Where2Place、BLINK、CV-Bench、EmbSpatial、MindCube、RoboSpatial-VQA、SAT、Cosmos-Reason1、Min Video Pairs、OpenEQA、以及 VSI-Bench。

语义安全与 ASIMOV 基准

为确保在以人为中心的环境中负责任地部署,Google DeepMind 更新了 ASIMOV 基准,该基准是一组用于评估语义安全的数据集。Gemini Robotics-ER 1.5 在该基准上表现出最先进的性能。

安全通过整体方法实现:

  • 高层推理: 模型在行动前考虑安全约束。
  • 策略对齐: 对话遵循 Gemini 安全策略。
  • 低层触发器: 系统可在必要时触发机载安全子系统,例如防碰撞。

可用性

  • Gemini Robotics-ER 1.5: 通过 Google AI Studio 中的 Gemini API 向开发者开放。
  • Gemini Robotics 1.5: 目前仅向特定合作伙伴开放。

Sources