Gemini Robotics ER 2 リリースノート / 新機能

Google DeepMind は、ロボットの脳として機能することを目的とした高度な「具現化推論」モデル、Gemini Robotics ER 2 を発表しました。このモデルは、ロボットが人間と対話し、物理的環境を理解し、複数ステップのタスクを計画できるようにし、計画されたタスクは下位レベルのビジョン‑言語‑アクション (VLA) モデルに渡されてモーター実行が行われます。

リアルタイムタスクオーケストレーションとエージェント機能

Gemini Robotics ER 2 は、複雑なマルチステップワークフローをオーケストレーションする物理エージェントとして機能し、ロボットが自己修正し、未知の状況に汎化できるようにします。開発者は、ナビゲーション API や VLA モデルなどの低レベル制御インターフェースを、モデルがネイティブに呼び出せるツールとして統合でき、Google Search などのツールと併用できます。

オーケストレーションにおける主な改善点は次のとおりです:

  • レイテンシ削減: 双方向ストリーミングエンドポイントを介した Gemini Live API との統合により「止まって考える」待機が最小化され、タスクの流動的な実行が可能になります。
  • パフォーマンス向上: 実際の VLA、シミュレートされた VLA、ヒューマンテレオペレーションモードすべてで、Gemini Robotics ER 1.6 を上回るツールオーケストレーション性能を示します。
  • 実用的な応用例: Boston Dynamics の Spot を用いたデモでは、自然言語コマンドに基づき、Spot API をオーケストレーションしてナビゲーションとマニピュレータの動作で物体を取得しました。

時間的インテリジェンスとビデオ理解

Gemini Robotics ER 2 は「時間的インテリジェンス」に大きな進歩をもたらし、ロボットが進捗を追跡し、タスク遷移の正確なタイミングを特定できるようにします。

継続的進捗分類

モデルはビデオフィードのフレームを 5 つの進捗レベル(0‑20% から 80‑100%)に分類し、タスク完了に向けた進捗を追跡します。これにより、ロボットはリアルタイムで動作を調整したり、全体のワークフローを再開せずに失敗したステップを再試行したりできます。Gemini Robotics ER 2 は進捗分類で 57.4% の正確率を達成し、前世代および競合フロンティアモデルを上回ります。

高精度モーメント検出

タスクを切り替える正確な瞬間(例: 液体の注ぎ止め)を決定するために、モデルはモーメント検出を利用します。正確率は 91.3%、平均絶対誤差は 0.96 秒です。この精度は、より大きなモデルカテゴリの 4 倍の実行速度で提供され、実世界で安全に動作するために必要なサブ秒レイテンシを実現します。

マルチロボット協調と空間インテリジェンス

Gemini Robotics ER 2 は、共有されたセマンティック理解を通じて多様なロボットが通信し、単体ロボットでは実行できないタスクを共同で完了できるようにします。この協調は Apptronik の Apollo 2 と Franka F3 Duo を用いた実証実験で示されています。

さらに、モデルは次の 3 つのコア領域で一般的な空間インテリジェンスを向上させました:

  • 成功/失敗検出: 静止画像ではなく、生動画フィードを使用して、滑りやこぼれなどの実行中の失敗を検出します。
  • 一般的な計器読み取り: デジタルディスプレイ、リニアスケール、液体温度計など、10 種類の計器を読み取れるようになりました。
  • 強化された空間 VQA: 高度なマルチモーダル理解により、視覚質問応答機能が改善されました。

安全性とヒューマンプロキシミティ

Gemini Robotics ER 2 は、Google DeepMind がこれまでにリリースした中で最も安全な具現化推論モデルと位置付けられています。Safety Instruction Following と Human Proximity ベンチマークで大幅な向上を示し、例えばヒューマンが近くにいるとヒューマノイドロボットを停止させ、エリアがクリアになるまで再開しない能力を実証しました。

Google DeepMind は、環境を監視し安全制約を強制し、物理的実現可能性を評価する安全な VLA オーケストレーターとしての基盤モデルの能力を測定する新しいベンチマークも導入しました。

Sources