starVLA/starVLA

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

解決的問題

StarVLA 是一個模組化研究平台,旨在簡化通用機器人視覺-語言-行動(VLA)模型的開發。它透過提供一個『樂高式』的程式碼庫,解決了建構這些系統的複雜性,讓模型骨幹、動作頭與訓練配方等元件可以自由交換與整合,而無需重寫整個流程。

工作原理

該平台採用解耦、可組合的架構,將訓練基礎設施與特定模型架構分離。使用者可插入不同的基礎模型骨幹(如 Qwen 系列或 Florence-2)與可交換的動作頭(例如自動回歸離散標記、並行連續解碼或流匹配專家)。系統維持標準化的模型前向介面與模型無關的資料載入器,確保無論選擇哪種框架變體,資料流皆能保持一致。

適用對象

主要針對正在建構通用機器人策略,並嘗試不同 VLA 架構、訓練範式與基準測試的機器人研究人員與開發者。

主要亮點

  • 模組化架構:支援快速原型設計,允許獨立除錯與「煙霧測試」子模組。
  • 多樣化的動作頭:包含 StarVLA-FAST、StarVLA-OFT、StarVLA-PI 與 StarVLA-GR00T 的實作。
  • 廣泛的基準支援:與 SimplerEnv、LIBERO、Robocasa、RoboTwin 2.0 與 RoboDojo 等多個基準整合。
  • 彈性訓練方式:支援監督微調(SFT)、多模態共同訓練,以及透過 RLinf 實現的強化學習後訓練。
  • 硬體相容性:支援在 Ascend NPU 與單一 A100 GPU 上訓練較小的 VLM。

相關