Gemini Robotics 2: 全身の知能と器用さの進化

Gemini Robotics 2 は全身の協調動作とマルチロボットのチームワークを可能にする

Google DeepMind は、ロボティクスを事前にプログラムされた反復的なタスクから、汎用的な物理的 AI へと進化させるために設計されたインテリジェンス・レイヤーである Gemini Robotics 2 をリリースしました。このシステムは、ロボットが複雑な動きを推論し、足先から指先まで全身を協調させ、他のロボットと協力して多段階のワークフローを完了することを可能にします。

3つのモデル・アーキテクチャ

Gemini Robotics 2 は、高レベルの推論と低レベルの運動制御の間で役割を分担する、3つの特化型モデルによって駆動されています。

  • Gemini Robotics 2 (VLA): 視覚および言語入力を直接運動制御に変換する Vision-Language-Action モデルです。5本指の手やパラレルグリッパーの両方において、完全なヒューマノイドの動きと高度な器用さを伴う操作を管理します。
  • Gemini Robotics ER 2 (ER): エージェントの「脳」として機能する Embodied Reasoning モデル (VLM) です。人間とのコミュニケーション、環境の理解、および数分間にわたる多段階タスクの計画を扱います。このモデルは、マルチロボットのコラボレーションも調整します。
  • Gemini Robotics On-Device 2 (VLA): ネットワーク遅延を排除するためにローカル実行に最適化された、効率的な VLA モデルです。「モーション・トランスファー」機能を備えており、200個未満の例を使用することで、数時間以内に新しいロボットの形態(異なる形状、センサー、自由度)に適応させることが可能です。

全身制御と高度な器用さ

Gemini Robotics 2 は、物理的 AI を単純な卓上タスクから全身の協調動作へと拡張します。意図を全身制御に変換することで、システムは、特定の場所への歩行、しゃがむ動作、そして下の棚に物体を正確に配置するといった複雑なシーケンスを管理できます。

高精度な操作

このシステムは、異なるハードウェア・エンドエフェクタにおいて、器用さの大きな飛躍を示しています。

  • 5本指の手: Apollo 2 ヒューマノイドに搭載された 22 自由度の SharpaWave hand を使用して、結び目を作る、ジッパー付きバッグを密閉するといった繊細なタスクを実行できます。
  • パラレルグリッパー: Franka Duo プラットフォームにおいて、標準的な2本指グリッパーを使用して複雑なパッキング・タスクを実行します。

エージェント的推論と安全性のオーケストレーション

数分間にわたり、数百の決定を伴うタスクを管理するために、Gemini Robotics ER 2 は高レベルのオーケストレーションを提供します。環境を観察し、必要なステップを推論し、特定の動作が失敗した場合には自己修正を行います。

安全性と ASIMOV-Agentic ベンチマーク

Google は、エージェント的な安全性のオーケストレーションのための新しいベンチマークである ASIMOV-Agentic を導入しました。このフレームワークは、ロボットの以下の能力を測定します。

  1. VLA によって要求された安全でないツール呼び出しを拒否すること。
  2. タスクが物理的に可能かどうかを予測すること。
  3. 不確実性が高い場合に、積極的に人間に介入を求めること。

さらに、Gemini Robotics ER 2 は、人間の接近を検知して、協調安全基準に準拠するために安全停止をトリガーするよう設計されています。

技術的視点とコミュニティの議論

発表は大きな進歩を強調していますが、技術コミュニティは、LLM ベースのロボティクスの実用的な展開に関して、いくつかの重要な指摘を行っています。

遅延と制御

一部の開発者は、アクチュエーション(駆動)に完全な LLM を使用することは、許容できない遅延(推定 1-2 秒)を導入する可能性があると主張しています。これはリアルタイムのロボティクスにおいて非実用的です。一般的な対案として、ML で視覚を扱い、運動駆動には従来の PID スタイルの線形/非線形制御を維持するという提案があります。

ハードウェアと安全性の懸念

ユーザー間の議論では、家庭環境における強力なヒューマノイド・ロボットの「訴訟リスク」が指摘されており、重労働を行うのに十分な強さを持つロボットは、誤作動した場合に深刻な負傷を引き起こす可能性もあると述べています。

パフォーマンス・メトリクス

批判的な意見を持つ人々は、付随する技術データが成功率 約 60% および精度 80% を示唆していることを指摘し、これらの数値は、技術が自律的な家庭用または産業用での実用段階にはまだ達していないことを示していると主張しています。

"If progress is as fast as LLMs, this could have massive applications in a few years." — @FartyMcFarter

"The big one will be using AI to design and build highly specialized robots to automate mining and manufacturing." — @baron816

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch