VLARLKit/VLARLKit

Elegant VLA-RL library

解決的問題

VLARLKit 為使用強化學習 (RL) 訓練 Vision-Language-Action (VLA) 模型提供了研究人員友好的框架。它透過將基礎模型、RL 訓練棧和機器人模擬環境解耦為獨立的專案與進程,解決了這些組件之間常見的依賴衝突問題。

工作原理

該函式庫採用模組化架構,將 policy、rollout、runner 和 model 層分離。為了防止軟體衝突,它採用了依賴解耦設計,其中模型後端作為獨立專案管理,基準測試環境作為獨立的 ZMQ 進程執行。它支援 on-policy 和 off-policy 訓練,包括允許數據收集與模型更新同步進行的非同步 off-policy 訓練。

適用對象

專為從事具身智能 (embodied intelligence) 和 VLA 模型研究、需要靈活且易於擴展的 PyTorch 函式庫進行 RL 實驗的 AI 研究人員設計。

亮點

  • 解耦架構:分離基礎模型與模擬器依賴,避免安裝衝突。
  • 廣泛的演算法支援:包括 on-policy (PPO, GRPO)、off-policy (DSRL, RLT) 和基於模型的 RL (VLA-MBPO)。
  • VLA 模型整合:支援 π†.₅ 等基於流的模型和 OpenVLA-OFT 等自回歸模型。
  • 模擬基準測試:整合支援 LIBERO、ManiSkill 和 RoboTwin。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案