agentscope-ai/Trinity-RFT

Trinity-RFT is a general-purpose, flexible and scalable framework designed for reinforcement fine-tuning (RFT) of large language models (LLM).

何を解決するか

Trinity-RFT は、大規模言語モデル(LLM)の強化学習微調整(RFT)のための統合的で柔軟なフレームワークを提供します。経験生成、モデル更新、データ管理を分離することで、強化学習によるLLM能力の向上プロセスを簡素化します。

動作方法

このフレームワークは3つのコアコンポーネントで構成されています:

  • Explorer:エージェントと環境の相互作用を処理し、経験データを生成します。
  • Trainer:収集されたデータに基づいて損失を最小化することで、モデルの重みを更新します。
  • Buffer:データパイプラインを管理し、RFTライフサイクル全体にわたってデータの処理、クリーニング、拡張を担当します。

さまざまなRFTモードをサポートしており、同期/非同期、オンポリシー/オフポリシー、オンライン/オフラインRLを含み、ロールアウトとトレーニングをデバイス間で独立してスケーリング可能です。

対象ユーザー

  • 特定のドメイン向けにLLM駆動エージェントをトレーニングしたいエージェントアプリケーション開発者
  • プラグアンドプレイモジュールを使って新しいRLアルゴリズムを実装・検証したい強化学習研究者
  • RFTデータセットの作成や、ヒューマンインザループを含む複雑なデータパイプラインの構築に注力するデータエンジニア

主な特徴

  • エージェント指向RLサポート:AgentScopeなどのフレームワークで開発されたマルチステップワークフローを含むエージェントアプリケーションを直接トレーニング可能。
  • 包括的なアルゴリズムサポート:PPO、GRPO、DPO、SFT、およびCHORDやRECなどの特殊なバリアントを含む幅広いアルゴリズムを実装。
  • ライフサイクル全体のデータパイプライン:優先度付け、クリーニングを備えたアクティブなデータ管理と、マルチタスク共同学習のネイティブサポートを提供。
  • 柔軟なデプロイメント:VLMトレーニング、LoRA、およびローカルGPUのないユーザー向けのTinkerバックエンドをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト