2toinf/X-VLA

[ICLR 2026] The offical Implementation of "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"

解決的問題

X-VLA 解決了在不同機器人平台(具身)上訓練通用視覺-語言-動作(VLA)模型的挑戰。它利用異構機器人資料集,建構一個在多種硬體上具有良好泛化能力的模型,從而提升機器人操作任務中的靈巧性與適應性。

工作原理

X-VLA 採用軟提示(soft-prompted)的 Transformer 架構。它引入與具身相關的可學習嵌入(軟提示),引導統一的 Transformer 主幹網絡在多個領域學習策略。為保持一致性,它採用統一的末端執行器6D(EE6D)控制空間,用於本體感覺輸入和動作輸出。

適用對象

本專案適用於希望在物理機器人或 LeRobot 等模擬平台中部署可擴展、跨平台 VLA 模型的機器人研究人員與開發者。

主要亮點

  • 跨具身泛化能力:在六個模擬平台和三台真實機器人上實現最先進性能。
  • 伺服器-客戶端架構:將模型環境與機器人特定依賴分離,避免套件衝突,並支援分散式推論。
  • 統一控制空間:使用標準化的 EE6D 控制空間,確保不同機械臂之間的一致性。
  • 可擴展的訓練:支援 LoRA 微調與模組化資料集介面,便於新增自訂機器人示範。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案