XiaomiRobotics/Xiaomi-Robotics-1

Code for Xiaomi-Robotics-1

解決的問題

Xiaomi-Robotics-1 (XR-1) 解決了機器人領域的「數據障礙」——即限制策略模型擴展的高品質、人工標註機器人數據的匱乏問題。它使機器人能夠在未見過的環境中執行移動操作,並利用極少的演示數據適應新的複雜任務。

工作原理

XR-1 是一種 Vision-Language-Action (VLA) 模型,它使用 Mixture-of-Transformers (MoT) 架構將預訓練的 Vision-Language Model (Qwen3-VL) 與 Diffusion-Transformer (DiT) 相結合。它採用兩階段訓練過程:

  1. 預訓練:在超過 100,000 小時的「embodiment-free」軌跡上訓練模型。自動標註流水線對這些軌跡進行分段並生成狀態轉換描述,使模型在不需要特定機器人硬體數據的情況下學習通用的動作生成。
  2. 後訓練:使用跨具身數據(真實機器人與開源數據)對模型進行對齊,將通用能力映射到特定的機器人硬體,並將模型與自然語言指令對齊。

適用對象

該專案專為構建移動操作基礎模型的機器人研究人員與開發人員,以及尋求部署可在不同環境與任務中泛化的通用機器人策略的人士而設計。

亮點

  • 大規模:在超過 1,700 個場景的 10 萬小時以上真實世界操作軌跡上進行了預訓練。
  • SOTA 性能:在 RoboCasa365 與 RoboDojo 排行榜上排名第一。
  • 數據效率:每個任務僅需幾小時的演示即可學習新的複雜任務。
  • 即時優化:採用非同步執行以降低推理延遲,並針對消費級 GPU 進行了優化。

相關

  • Dispatch
  • 專案
  • 專案
  • Dispatch
  • 專案