XiaomiRobotics/Xiaomi-Robotics-1

Code for Xiaomi-Robotics-1

解決する課題

Xiaomi-Robotics-1 (XR-1) は、ロボティクスにおける「データの壁」、すなわちポリシーモデルのスケールアップを制限している高品質で手動ラベル付けされたロボットデータの不足に対処します。これにより、ロボットは未知の環境でのモバイルマニピュレーションを実行し、極めて少ないデモンストレーションデータで新しい複雑なタスクに適応することが可能になります。

仕組み

XR-1 は、事前学習済みの Vision-Language Model (Qwen3-VL) と Diffusion-Transformer (DiT) を Mixture-of-Transformers (MoT) アーキテクチャを用いて組み合わせた Vision-Language-Action (VLA) モデルです。以下の2段階のトレーニングプロセスを採用しています:

  1. 事前学習: 100,000時間以上の「embodiment-free」な軌跡データでモデルを学習させます。自動ラベル付けパイプラインがこれらの軌跡をセグメント化し、状態遷移の記述を生成することで、特定のロボットハードウェアのデータを必要とせずに、モデルに一般的なアクション生成を学習させます。
  2. 事後学習: クロスエンボディメントデータ(実機ロボットおよびオープンソースデータ)を使用してモデルの整合性を図り、一般的な能力を特定のロボットハードウェアにマッピングし、自然言語の指示にモデルを適応させます。

対象者

このプロジェクトは、モバイルマニピュレーションのための基盤モデルを構築しているロボティクス研究者や開発者、および異なる環境やタスクに汎用できる汎用ロボットポリシーの展開を目指す方を対象としています。

ハイライト

  • 大規模スケール: 1,700以上のシナリオにわたる100K時間以上の実世界の操作軌跡で事前学習済み。
  • SOTAパフォーマンス: RoboCasa365 および RoboDojo のリーダーボードで第1位を獲得。
  • データ効率: タスクごとに数時間のデモンストレーションだけで、新しい複雑なタスクを学習可能。
  • リアルタイム最適化: 非同期実行を使用して推論レイテンシを低減し、コンシューマ向けGPU向けに最適化されています。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト