2toinf/X-VLA
[ICLR 2026] The offical Implementation of "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"
解決的問題
X-VLA 解決了在不同機器人平台(具身)上訓練通用視覺-語言-動作(VLA)模型的挑戰。它利用異構機器人資料集,建構一個在多種硬體上具有良好泛化能力的模型,從而提升機器人操作任務中的靈巧性與適應性。
工作原理
X-VLA 採用軟提示(soft-prompted)的 Transformer 架構。它引入與具身相關的可學習嵌入(軟提示),引導統一的 Transformer 主幹網絡在多個領域學習策略。為保持一致性,它採用統一的末端執行器6D(EE6D)控制空間,用於本體感覺輸入和動作輸出。
適用對象
本專案適用於希望在物理機器人或 LeRobot 等模擬平台中部署可擴展、跨平台 VLA 模型的機器人研究人員與開發者。
主要亮點
- 跨具身泛化能力:在六個模擬平台和三台真實機器人上實現最先進性能。
- 伺服器-客戶端架構:將模型環境與機器人特定依賴分離,避免套件衝突,並支援分散式推論。
- 統一控制空間:使用標準化的 EE6D 控制空間,確保不同機械臂之間的一致性。
- 可擴展的訓練:支援 LoRA 微調與模組化資料集介面,便於新增自訂機器人示範。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案