VLARLKit/VLARLKit
Elegant VLA-RL library
解決的問題
VLARLKit 為使用強化學習 (RL) 訓練 Vision-Language-Action (VLA) 模型提供了研究人員友好的框架。它透過將基礎模型、RL 訓練棧和機器人模擬環境解耦為獨立的專案與進程,解決了這些組件之間常見的依賴衝突問題。
工作原理
該函式庫採用模組化架構,將 policy、rollout、runner 和 model 層分離。為了防止軟體衝突,它採用了依賴解耦設計,其中模型後端作為獨立專案管理,基準測試環境作為獨立的 ZMQ 進程執行。它支援 on-policy 和 off-policy 訓練,包括允許數據收集與模型更新同步進行的非同步 off-policy 訓練。
適用對象
專為從事具身智能 (embodied intelligence) 和 VLA 模型研究、需要靈活且易於擴展的 PyTorch 函式庫進行 RL 實驗的 AI 研究人員設計。
亮點
- 解耦架構:分離基礎模型與模擬器依賴,避免安裝衝突。
- 廣泛的演算法支援:包括 on-policy (PPO, GRPO)、off-policy (DSRL, RLT) 和基於模型的 RL (VLA-MBPO)。
- VLA 模型整合:支援 π†.₅ 等基於流的模型和 OpenVLA-OFT 等自回歸模型。
- 模擬基準測試:整合支援 LIBERO、ManiSkill 和 RoboTwin。
相關
- 專案
- 專案
- 專案
- 專案
- 專案