NovaSky-AI/SkyRL
SkyRL: A Modular Full-stack RL Library for LLMs
何を解決するか
SkyRLは、大規模言語モデル(LLM)における強化学習(RL)をよりアクセスしやすく、効率的にするために設計されたモジュール型フルスタックライブラリです。特に、コード作成、SQL生成、ターミナル操作など、複数ターンのツール使用を伴う長時間スパンの現実世界タスクを処理できるエージェントのトレーニングという課題に特化しています。
仕組み
SkyRLは、いくつかの専門的なコンポーネントに構成されています:
- skyrl: ローカルハードウェア上でRLトレーニングを行うための統合ライブラリで、モジュール型トレーニングフレームワーク(
skyrl-train)とTinker API用のクロスプラットフォームバックエンド(skyrl-tx)を統合しています。 - skyrl-agent: 長時間スパンのタスクにおける複数ターンのツール使用LLM向けのパイプラインの最適化とスケーラビリティに焦点を当てたエージェントレイヤーです。
- skyrl-gym: Gymnasium APIを用いて実装されたRL環境のコレクションで、数学、コード作成、検索、SQLなどのタスクを提供します。
対象ユーザー
このライブラリは、RLチューニングされたLLMを開発するAI研究者や開発者を対象としており、特にエージェントワークフロー、ツール使用機能、長時間スパンの問題解決に注力している方々に適しています。
特徴
- Tinker API対応: Tinker API用のバックエンドを実装しており、ユーザーがそのAPI用に書かれたトレーニングスクリプトを自前のGPUで実行できるようにします。
- モジュールアーキテクチャ: トレーニングフレームワーク、エージェントレイヤー、環境ライブラリ(Gymnasium API)を別々に提供します。
- 長時間スパンに特化: SWE-Benchやターミナル使用エージェントなど、現実世界のタスクに最適化されています。
- オンポリシー蒸留: オンポリシー蒸留や、進行中の重み更新を伴う完全非同期RLといった高度なRL技術をサポートしています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト