Xiaomi-Robotics-1: 10万時間のデータによるVision-Language-Actionモデルのスケーリング

Xiaomi-Robotics-1: 10万時間のデータによるVision-Language-Actionモデルのスケーリング

Xiaomi-Robotics-1は、大規模な「embodiment-free(身体性なし)」の事前学習と、それに続く「embodiment(身体性)」および「instruction(指示)」のアライメントという2段階の学習プロセスを用いることで、高品質なロボットデータの不足を克服するように設計されたロボット基盤モデルです。このアプローチにより、モデルはデータ量とモデルサイズに応じて予測可能な形でスケーリングが可能となり、実世界のモバイルマニピュレーションタスクやシミュレーションベンチマークにおいて成功率の向上を実現しています。

ロボットデータのボトルネックを打破する

ロボティクスにおいて、高品質で実機を用いたロボットデータの収集は困難かつ高コストであるため、歴史的にポリシーモデルのスケーリングが課題となってきました。Xiaomi-Robotics-1は、「embodiment-free」(UMI)事前学習を活用することで、この問題に対処します。

UMIデータによる事前学習

事前学習段階において、Xiaomiは家庭、商業、産業、屋外スペースを含む1,700以上のシナリオにわたる、100,000時間のembodiment-freeな軌跡データを使用しています。この大規模なデータを扱うため、彼らはVision-Language Model (VLM) を活用した自動ラベル付けパイプラインを開発しました。これは、軌跡を固定長のセグメントに分割し、シーンの状態遷移に関する言語記述でアノテーションを付与するものです。

事後学習とアライメント

事前学習に続いて、モデルは、一般的なアクション生成能力を特定のロボットハードウェアや人間の指示に適合させるための事後学習段階を経ます。このアライメントは、以下の2つの軸で行われます。

  1. Embodiment Alignment(身体性アライメント): 高品質なクロス・エンボディメントの実機ロボットデータ(例:ソファの整理、靴箱の仕分けなど、実際の家庭での7,200時間以上のインハウスデータを含む)を使用して、一般的なアクション生成能力を実際の物理ロボットにマッピングします。
  2. Instruction Alignment(指示アライメント): モデルを、状態遷移の記述に基づくアクション生成から、自然言語による指示を直接実行する形へと移行させます。

ロボティクスにおけるスケーリング則

Xiaomi-Robotics-1は、ロボット基盤モデルが明確なスケーリング挙動を示すことを証明しています。事前学習データの量とモデルサイズが増加するにつれて、検証用アクションエラーは減少し、未知の環境における実機ロボットの成功率は、着実に、かつ予測可能な形で上昇します。

ソース資料によると、スケーリングによる利得は飽和の兆候を見せておらず、これは、より強力な事前学習済みモデルが、事後学習後に一貫して優れた実機ロボットのパフォーマンスをもたらすことを意味します。

パフォーマンスとアプリケーション

Xiaomi-Robotics-1は、最小限の実機デモンストレーションで、新しい複雑なタスクに効率的に適応できる基盤モデルとして機能します。

効率的なタスク適応

タスクあたり平均10時間未満のデモンストレーションで、モデルは電話の梱包、プリンターのインク補充、洗濯物の積み込みなどのタスクにおいて75%の総合成功率を達成しています。これは、$\pi 0.5$のベースライン(40%)のパフォーマンスをほぼ倍増させたものです。予算をタタスクあたり40時間未満に増やした場合、総合成功率はおよそ85%に上昇します。

Task <10 h/task (XR-1) <10 h/task ($\pi 0.5$) <40 h/task (XR-1) <40 h/task ($\pi 0.5$)
Phone Packing 70% 30% 80% 40%
Printer Refilling 70% 20% 60% 20%
Laundry Loading 80% 40% 80% 50%
Box Packing 80% 70% 100% 100%
Overall 75% 40% 85% 53%

シミュレーションベンチマーク

Xiaomi-Robotics-1は、汎化性能を重視する4つの主要なシミュレーションベンチマークにおいて、最先端(SOTA)の結果を達成しています。

| Benchmark | XR-1 Success Rate | 2nd Best | Relative Gain | | :--- | :--- | :--- | :--- | :--- | | RoboCasa | 74.5% | 72.6% | +2.6% | | RoboCasa365 | 57.4% | 46.6% | +23.2% | | VLABench | 59.1% | 53.2% | +11.1% | | RoboDojo | 13.93% | 8.80% | +58.3% |

コミュニティの洞察と技術的議論

Hacker Newsの技術的な観察者たちは、ビデオデモンストレーションに示されたタスクの複雑さを議論しており、モデルが歴史的に困難であったいくつかのロボティクス問題を同時に処理している点に注目しています。

"Coordinating two hands - Mobile body - Deformable objects - Thin affordances (bag zip in particular) - Multi-object single grasp... a host of things that had individually been tackled as either perception or manipulation problems."

他のユーザーは、家事支援ロボティクスの未来について楽観的な見解を示していますが、一部のユーザーはモデルや重みの公開について疑問を呈しています。あるユーザーは、XiaomiRobotics-0の資産は利用可能である一方、Xiaomi-Robotics-1のモデルやデータセットは、GitHubやHugging Faceのレポジトリにはまだ存在していないと指摘しています。

結論

Xiaomi-Robotics-1は、大規模なembodiment-freeな事前学習が、ロボット基盤モデルのスケーリングにおける実行可能な道筋であることを証明しています。データボトルネックを打破し、一般的な能力を能力を物理ロボットにアライメントすることで、Xiaomiは、未知の環境に良好に汎化し、高いデータ効率で新しいタスクに適応できるモデルを創造しました。

Sources