VLARLKit/VLARLKit

Elegant VLA-RL library

解決する課題

VLARLKitは、強化学習 (RL) を用いてVision-Language-Action (VLA) モデルを訓練するための、研究者フレンドリーなフレームワークを提供します。ベースモデル、RL訓練スタック、およびロボットシミュレーション環境の間でよく発生する依存関係の競合問題を、これらを個別のプロジェクトとプロセスに分離することで解決します。

仕組み

本ライブラリは、policy、rollout、runner、およびmodelの各レイヤーを分離したモジュール式アーキテクチャを採用しています。ソフトウェアの競合を防ぐため、モデルバックエンドを個別のプロジェクトとして管理し、ベンチマーク環境を独立したZMQプロセスとして実行する、依存関係を分離した設計を採用しています。また、on-policyおよびoff-policyの両方の訓練をサポートしており、データ収集とモデルの更新を同時に行うための非同期off-policy訓練も可能です。

対象者

具現化された知能(embodied intelligence)やVLAモデルの研究を行っており、RL実験のために柔軟で拡張しやすいPyTorchライブラリを必要とするAI研究者向けに設計されています。

ハイライト

  • デカップルされたアーキテクチャ: ベースモデルとシミュレータの依存関係を分離し、インストール時の競合を回避します。
  • 幅広いアルゴリズムのサポート: on-policy (PPO, GRPO)、off-policy (DSRL, RLT)、およびモデルベースRL (VLA-MBPO) を含みます。
  • VLAモデルの統合: π†.₅ のようなフローベースのモデルや、OpenVLA-OFT のような自己回帰モデルをサポートしています。
  • シミュレーションベンチマーク: LIBERO、ManiSkill、および RoboTwin を統合サポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト