agentscope-ai/Trinity-RFT
Trinity-RFT is a general-purpose, flexible and scalable framework designed for reinforcement fine-tuning (RFT) of large language models (LLM).
何を解決するか
Trinity-RFT は、大規模言語モデル(LLM)の強化学習微調整(RFT)のための統合的で柔軟なフレームワークを提供します。経験生成、モデル更新、データ管理を分離することで、強化学習によるLLM能力の向上プロセスを簡素化します。
動作方法
このフレームワークは3つのコアコンポーネントで構成されています:
- Explorer:エージェントと環境の相互作用を処理し、経験データを生成します。
- Trainer:収集されたデータに基づいて損失を最小化することで、モデルの重みを更新します。
- Buffer:データパイプラインを管理し、RFTライフサイクル全体にわたってデータの処理、クリーニング、拡張を担当します。
さまざまなRFTモードをサポートしており、同期/非同期、オンポリシー/オフポリシー、オンライン/オフラインRLを含み、ロールアウトとトレーニングをデバイス間で独立してスケーリング可能です。
対象ユーザー
- 特定のドメイン向けにLLM駆動エージェントをトレーニングしたいエージェントアプリケーション開発者。
- プラグアンドプレイモジュールを使って新しいRLアルゴリズムを実装・検証したい強化学習研究者。
- RFTデータセットの作成や、ヒューマンインザループを含む複雑なデータパイプラインの構築に注力するデータエンジニア。
主な特徴
- エージェント指向RLサポート:AgentScopeなどのフレームワークで開発されたマルチステップワークフローを含むエージェントアプリケーションを直接トレーニング可能。
- 包括的なアルゴリズムサポート:PPO、GRPO、DPO、SFT、およびCHORDやRECなどの特殊なバリアントを含む幅広いアルゴリズムを実装。
- ライフサイクル全体のデータパイプライン:優先度付け、クリーニングを備えたアクティブなデータ管理と、マルチタスク共同学習のネイティブサポートを提供。
- 柔軟なデプロイメント:VLMトレーニング、LoRA、およびローカルGPUのないユーザー向けのTinkerバックエンドをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト