Xiaomi-Robotics-1: 使用 100,000 小時數據擴展視覺-語言-動作模型
Xiaomi-Robotics-1: 使用 100,000 小時數據擴展視覺-語言-動作模型
Xiaomi-Robotics-1 是一款機器人基礎模型,旨在透過兩階段訓練流程:大規模「非具身」(embodiment-free)預訓練,隨後進行具身與指令對齊,來克服高品質機器人數據稀缺的問題。這種方法讓模型能隨著數據量與模型規模的增加而可預測地擴展,從而在現實世界的移動操作任務與模擬基準測試中,實現更高的成功率。
打破機器人數據瓶頸
機器人技術在擴展策略模型方面一直面臨挑戰,因為高品質、真實機器人的數據收集既困難且昂貴。Xiaomi-Robotics-1 透過利用「非具身」(UMI)預訓練來解決此問題。
使用 UMI 數據進行預訓練
在預訓練階段,Xiaomi 使用了橫跨超過 1,700 種場景(包括家庭、商業、商用、工業與戶外空間)的 100,000 小時 非具身軌跡數據。為了處理如此大規模的數據,他們開發了一套由視覺語言模型(VLM)驅動的自動標註流程,將軌跡劃分為固定長度的片段,並使用場景狀態轉換的語言描述進行標註。
後訓練與對齊
在預訓練之後,模型會進入後訓練階段,將其通用的動作生成能力與特定的機器人硬體及人類指令進行對齊。這種對齊包含兩個維度:
- 具身對齊 (Embodiment Alignment):利用高品質的跨具身真實機器人數據,將通用的動作生成能力映射到實際的物理機器人上,其中包括來自真實家庭環境的超過 7,200 小時 的內部數據(例如:整理索非亞、整理鞋櫃)。
- 指令對齊 (Instruction Alignment):將模型從基於狀態轉換描述生成動作,轉變為直接執行自然語言指令。
機器人技術中的擴展定律 (Scaling Laws)
Xiaomi-Robotics-1 證明了機器人基礎模型展現出清晰的擴展行為。隨著預訓練數據量與模型規模的增加,驗證動作誤差會降低,且在未知環境中的真實機器人成功率會穩定且可預測地提升。
根據原始資料顯示,擴展增益並未出現飽和跡象,這意味著更強大的預訓練模型在經過後訓練後,能持續產生更好的真實機器人表現。
性能與應用
Xiaomi-Robotics-1 作為一個基礎模型,可以透過極少的真實機器人演示來,高效地適應新且複雜的任務。
高效的任務適應性
在每個任務平均使用低於 10 小時的演示數據時,該模型在手機包裝、印表機加墨、以及洗衣機裝載等任務中達到了 75% 的整體成功率。這幾乎是 $\pi 0.5$ 基準線(40%)的兩倍。當預算增加到每個任務低於 40 小時時,整體成功率提升至 85%。
| 任務 | <10 h/task (XR-1) | <10 h/task ($\pi 0.5$) | <40 h/task (XR-1) | <40 h/task ($\pi 0.5$) |
|---|---|---|---|---|
| 手機包裝 | 70% | 30% | 80% | 40% |
| 印表機加墨 | 70% | 20% | 60% | 20% |
| 洗衣機裝載 | 80% | 40% | 80% | 50% |
| 紙箱包裝 | 80% | 70% | 100% | 100% |
| 整體 | 75% | 40% | 85% | 53% |
模擬基準測試
Xiaomi-Robotics-1 在四個強調泛化能力的的主流模擬基準測試中,達到了尖端(SOTA)的結果:
| 基準測試 | XR-1 成功率 | 第二名 | 相對增益 |
|---|---|---|---|
| RoboCasa | 74.5% | 72.6% | +2.6% |
| RoboCasa365 | 57.4% | 46.6% | +23.2% |
| VLABench | 59.1% | 53.2% | +11.1% |
| RoboDojo | 13.93% | 8.80% | +58.3% |
社群洞察與技術討論
Hacker News 上的技術觀察者討論了影片演示中任務的複雜度,指出該模型同時處理了幾個歷史上困難的機器人問題:
"Coordinating two hands - Mobile body - Deformable objects - Thin affordances (bag zip in particular) - Multi-object single grasp... a host of things that had individually been tackled as either perception or manipulation problems."
其他用戶對家務機器人的未來表示樂觀,同時也有人質疑模型的可用性與權重。一位用戶指出,雖然 XiaomiRobotics-0 的資產是可用的,但 Xiaomi-Robotics-1 的模型與數據集尚未出現在 GitHub 或 Hugging Face 儲存庫中。
結論
Xiaomi-Robotics-1 證明了大規模的「非具身」預訓練是一條可行的路徑,用以擴展機器人基礎模型。透過打破數據瓶頸並將通用能力對應到物理機器人上,Xiaomi 已開發出一個能良好泛化至未知環境,並能以高數據效率適應新任務的模型。