Qwen-RobotManip: アラインメントがロボット操作基盤モデルのスケールを解放する

Qwen-RobotManip は、一般化可能な Vision‑Language‑Action (VLA) 基盤モデルであり、ロボット操作データのスケーリングは統一されたアラインメントフレームワークと組み合わせたときにのみ有効であることを示しています。ロボットの形態、センサー、タスク間で表現をアラインすることで、38,100 時間以上のオープンソースおよび合成データを用いて、未知のシーン、未見の指示、クロスエンボディメント転送に対して優れた汎化性能を達成します。

統一クロスエンボディメントアラインメントフレームワーク

Qwen-RobotManip は、大規模マルチソース学習における矛盾するシグナルの問題を、表現・モーション・行動の三次元アラインメントを導入することで解決します。

正準状態‑アクション表現

すべてのロボット状態とアクションは、統一された 80 次元ベクトルにマッピングされます。このベクトルは、単腕、二腕、巧緻なハンド、モバイルベース構成をすべて受け入れます。異なるエンボディメント間の衝突を防ぐため、次元ごとのバイナリマスクが設定され、特定のロボットに対してのみ関連スロットに勾配が流れるようにします。

カメラフレーム・デルタポーズ

異なるロボットプラットフォーム間で視覚的に類似した動作を数値的に近接させるため、エンドエフェクタのアクションはロボットベースフレームではなくカメラ座標フレームでのデルタとして表現します。モデルはクロスアテンション層で Camera Positional Encoding (CaPE) を用いてカメラ外部パラメータを処理し、内部パラメータは視覚トークンにエンコードして視野認識を実現します。

インコンテキストポリシー適応

モデルは構造化されたエンボディメントプロンプト(ロボットプラットフォーム、実行速度、FPS を指定)と、過去の観測‑アクションチャンクを組み合わせて使用します。これにより Qwen-RobotManip はエンボディメントや行動パターンに応じてポリシーをオンザフライで適応させます。トレーニング時には確率的コンテキストサンプリング戦略を採用し、アクションコピーのショートカットに依存しないようにします。

大規模ヒューマン‑トゥ‑ロボットデータ合成

ロボット操作データが不足しているため、Qwen-RobotManip はエゴセントリックな人間操作ビデオをロボットデモに変換する合成パイプラインを利用します。

  • パイプライン: システムは 1,933 時間のエゴセントリック人間ビデオを、15 種類のエンボディメントにわたる 24,808 時間のロボットデモに変換します。これはアクションリターゲティング、手の除去とインペインティング、シミュレートレンダリング、深度誘導合成によって実現されます。
  • 総コーパス: 最終的な事前学習コーパスは約 38,100 時間で、ロボットデータ (11,420h)、エゴセントリック人間データ (1,933h)、合成ヒューマン‑トゥ‑ロボットデータ (~24,808h) から構成されます。
  • キュレーション: マルチステージパイプラインにより、5 段階の状態‑アクションフィルタリング(ノイズアクション除去と運動学的一貫性検証)と 3 つのクロスモーダルチェック(言語指示とビデオ内容の一致、視覚観測とロボット状態の一致)で品質が保証されます。

モデルアーキテクチャとトレーニング

Qwen-RobotManip は Qwen3.5-4B ビジョン‑言語バックボーンと、フローマッチング Diffusion Transformer (DiT) アクションヘッドを組み合わせています。

トレーニングは主に 2 つのフェーズで行われます:

  1. 事前学習: VLA ストリーム(ロボット操作データ)と VLM ストリーム(ビジョン‑言語理解データ)を 9:1 の比率で共同学習するデュアルストリーム共訓練アプローチを採用します。
  2. 事後学習: 各ベンチマークのすべてのデモデータに対して一般的な SFT(教師あり微調整)を実施し、VL と VLA データを同時に学習させて OOD 指示追従性能を向上させます。

アウト・オブ・ディストリビューション (OOD) 汎化性能

Qwen-RobotManip は OOD ベンチマークを成功の主要指標とし、イン・ディストリビューション (IID) スコアはパターンマッチングで達成できるだけで真の汎化とは言えないと主張します。

シミュレーションベンチマーク

  • LIBERO-Plus: Qwen-RobotManip-Context は全体成功率 91.4% を記録し、$ \pi_{0.5}$ の 84.4% を大きく上回ります。特にカメラやロボットの摂動に強いです。
  • RoboTwin-C2R Hard: 「Hard」環境ランダム化において成功率 69.4% を達成し、$ \pi_{0.5}$ より 21.5% 高いです。
  • RoboCasa365: 「Composite-Unseen」タスク(OOD シーンでの長時間タスク)で 14.9% の成功率を示し、次点モデルの 5.4% の約 3 倍です。
  • EBench: 全体成功率 45.6% を達成し、$ \pi_{0.5}$ の 27.1% と他のベースラインを上回ります。
  • RoboTwin-IF: 未見テンプレートでの指示追従において平均成功率 72.2% を記録し、$ \pi_{0.5}$ より 22.6 ポイント高いです。
  • RoboTwin-XE: ゼロショットクロスエンボディメント転送(AgileX ALOHA で学習し未見ロボットでテスト)で、カメラフレーム EEF 表現により成功率 23.9% を達成し、$ \pi_{0.5}$ (eef) の 3.2 倍です。

実世界評価

  • 新規シーンと指示: インドメイン成功率 88.6%、OOD 成功率 87.5% を記録し、$ \pi_{0.5}$ の OOD 成功率 37.5% を大きく上回ります。
  • Few‑Shot 適応: 5 タスクで合計 130 デモだけで微調整した場合、5 タスク中 4 タスクでベースラインを上回ります。
  • クロスエンボディメントスキル転送: CobotMagic と ARX データで微調整したポリシーが、未見の ARX タスクで 55.0% の成功率を達成し、統一フレームワークなしのアブレーション変種の 4 倍です。
  • RoboChallenge Table30 v1: 一般化トラックで 1 位、成功率 45% を記録し、3 位の参加者を 20% 上回ります。

スケーリングとリカバリに関する主要知見

  • アラインメントは前提条件: 研究は、統一されたクロスエンボディメント表現を持つモデルだけが対数線形のデータスケーリングを示すことを明らかにしました。アラインメントがない場合、データを増やしてもスケーリング曲線は不規則または平坦になります。
  • 二手協調: 二手協調タスクで 40% の成功率を達成し、$ \pi_{0.5}$ の 21.2% を大きく上回ります。「フライを皿に注ぐ」タスクで唯一成功したモデルで、成功率は 30% です。
  • エマージェントリカバリ: 大規模事前学習から自然に出現したリアクティブエラーリカバリ(例: スリップ後に自動で再把持)を示します。

Sources