Gemini Robotics 2:推动全身智能与灵巧度

Gemini Robotics 2 实现全身协同和多机器人团队合作

Google DeepMind 已发布 Gemini Robotics 2,这是一层智能系统,旨在将机器人技术从预先编程的重复任务推进到通用物理 AI。该系统使机器人能够推理复杂动作,协调从脚到指尖的整个身体,并与其他机器人协作完成多步骤工作流。

三模型架构

Gemini Robotics 2 由三种专用模型驱动,它们在高级推理和低级运动控制之间分工合作:

  • Gemini Robotics 2 (VLA): 一种视觉‑语言‑动作模型,直接将视觉和语言输入转换为运动控制。它管理完整的人形动作以及五指手和并行夹爪的高灵巧度操作。
  • Gemini Robotics ER 2 (ER): 一个具身推理模型(VLM),充当代理的“脑”。它处理人与机器的交流、环境理解以及持续数分钟的多步骤任务规划。该模型还协调多机器人协作。
  • Gemini Robotics On-Device 2 (VLA): 一个针对本地执行优化的高效 VLA 模型,以消除网络延迟。它具备“运动迁移”能力,能够在数小时内、使用不足 200 条示例的情况下适配新的机器人形态(不同的形状、传感器和自由度)。

全身控制与高级灵巧度

Gemini Robotics 2 将物理 AI 从简单的桌面任务扩展到全身协同。通过将意图转化为全身控制,系统能够管理诸如走向目标位置、蹲下并精确将物体放置在底层架子上的复杂序列。

高精度操作

系统在不同硬件末端执行器上展示了显著的灵巧度提升:

  • 五指手: 在 Apollo 2 人形机器人上使用 22 自由度的 SharpaWave 手,模型能够完成系结或封口拉链袋等精细任务。
  • 并行夹爪: 在 Franka Duo 平台上,模型使用标准的双指夹爪执行复杂的包装任务。

代理推理与安全编排

为管理跨越数分钟、涉及数百次决策的任务,Gemini Robotics ER 2 提供高级编排。它观察环境,推理所需步骤,并在特定动作失败时自行纠正。

安全性与 ASIMOV‑Agentic 基准

Google 推出了 ASIMOV‑Agentic,一个用于评估代理安全编排的新基准。该框架衡量机器人在以下方面的能力:

  1. 拒绝 VLA 请求的不安全工具调用。
  2. 预测任务是否在物理上可行。
  3. 在不确定性高时主动请求人工干预。

此外,Gemini Robotics ER 2 还设计了检测人体接近并触发安全停止的功能,以符合协作安全标准。

技术视角与社区讨论

虽然公告强调了显著进展,技术社区仍提出了若干关键问题,涉及基于 LLM 的机器人实际部署:

延迟与控制

一些开发者认为使用完整 LLM 进行驱动可能导致不可接受的延迟(估计 1‑2 秒),这对实时机器人而言不切实际。常见的反提议是将机器学习用于视觉,而保持传统的 PID‑式线性/非线性控制进行运动驱动。

硬件与安全顾虑

用户讨论中指出,强大的类人机器人在家庭环境中的“诉讼风险”,因为足以完成重体力劳动的机器人,同样也可能在故障时造成严重伤害。

性能指标

批评者引用随附的技术数据,指出成功率约为 60%,准确率为 80%,认为这些数字表明该技术尚未准备好用于自主的家庭或工业生产环境。

"If progress is as fast as LLMs, this could have massive applications in a few years." — @FartyMcFarter

"The big one will be using AI to design and build highly specialized robots to automate mining and manufacturing." — @baron816

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch