Gemini Robotics ER 2 发布说明 / 新功能
实时任务编排与自主能力
Gemini Robotics ER 2 充当物理代理,编排复杂的多步骤工作流,使机器人能够自我纠正并推广到新情境。开发者可以将低层控制接口——例如导航 API 或 VLA 模型——集成为模型可以原生调用的工具,同时还能使用 Google Search 等工具。
关键的编排改进包括:
- 延迟降低: 通过双向流式端点与 Gemini Live API 集成,最小化“停顿思考”暂停,实现任务的流畅执行。
- 性能提升: 该模型在真实 VLA、模拟 VLA 和人工遥操作模式下的工具编排方面始终优于 Gemini Robotics ER 1.6。
- 实际应用: 在与 Boston Dynamics 的 Spot 的演示中,模型编排了 Spot 的导航和机械臂移动 API,根据自然语言指令获取物体。
时序智能与视频理解
Gemini Robotics ER 2 在“时序智能”方面实现了重大突破,使机器人能够跟踪进度并识别任务切换的精确时刻。
连续进度分类
该模型通过将视频流中的帧划分为五个进度等级(0-20% 到 80-100%),来跟踪任务完成的进度。这使机器人能够实时调整动作或在不重新启动整个工作流的情况下重试失败的步骤。Gemini Robotics ER 2 在进度分类上达到 57.4% 的准确率,超越了前一代模型并与前沿模型竞争。
精确时刻定位
为了精确确定何时切换任务(例如何时停止倒液体),模型使用时刻定位。其准确率为 91.3%,平均绝对误差为 0.96 秒。这种精度以比大型模型类别快 4 倍的执行速度实现,提供了安全真实世界操作所需的亚秒级延迟。
多机器人协作与空间智能
Gemini Robotics ER 2 使不同的机器人能够通过共享的语义理解进行交流,完成单个机器人无法独立完成的任务。该协作已在 Apptronik 的 Apollo 2 与 Franka F3 Duo 上演示。
此外,模型在以下三个核心领域提升了通用空间智能:
- 成功/失败检测: 现在使用原始视频流而非静态快照来检测执行过程中的失误,如滑倒或溢出。
- 通用仪表读取: 模型现在能够读取 10 种不同类型的仪表,包括数字显示、线性刻度和液体温度计。
- 增强空间 VQA: 通过先进的多模态理解提升了视觉问答能力。
安全性与人与机器人距离
Gemini Robotics ER 2 被描述为 Google DeepMind 迄今为止最安全的具身推理模型。它在安全指令遵循和人与机器人距离基准测试中取得了显著提升,具体表现为在有人靠近时能够停止类人机器人,并在区域清空后才恢复运行。
Google DeepMind 还推出了一个新基准,用于评估基础模型作为安全 VLA 编排者的能力,包括监控环境、执行安全约束以及评估物理可行性。