inclusionAI/AReno
An easy-to-use, fast toolkit to scale up RL post-training on a single node.
何を解決するか
ARenoは、LLM強化学習(RL)およびポストトレーニングを、自己完結型の単一ノードツールキットとして利用可能にするように設計されています。複雑なクラスタ設定や、別々の推論サーバー、断片化されたトレーニングフレームワークの必要性を排除し、開発者が1台のマシン上でベースモデルのチェックポイントからトレーニング済みモデルのデプロイまでを実行できるようにします。
動作方法
ARenoは単一ノードのパフォーマンス最適化を目的としたフルスタック設計を採用しています。TrainerクラスとCLIを提供し、RLループ全体を処理します:オンポリシーの完了生成(ロールアウト)、ユーザー定義の報酬関数によるスコアリング、モデル重みの更新(トレーニング)。CUDA(Linux)およびMLX(Apple Silicon)の両バックエンドをネイティブでサポートしています。
対象ユーザー
大規模インフラストラクチャの管理負荷なしに、RL、SFT、またはDPOスタイルのトレーニングを使って、迅速かつローカルでLLMのポストトレーニングを実行したい研究者や開発者向けです。
特徴
- 即插即用:
--algoフラグまたはPython APIで、さまざまなポストトレーニングアルゴリズムに簡単にアクセス可能。 - エージェント型RL対応:ローカルのOpenAI互換プロキシと対話するエージェントのトレーニングをサポートし、トラジェクトリから学習可能。
- マルチモーダル対応:OpenAIスタイルのメッセージフォーマットを使用して、画像、音声、動画コンテンツに対応。
- ハードウェアの柔軟性:NVIDIA GPUはCUDA、Apple SiliconはMLXでネイティブサポート。
- 統合型サービング:連続バッチ処理を備えた組み込みOpenAI互換サーバーを提供し、トレーニング済みモデルを即座にデプロイ可能。
- オペレーションエージェント:ユーザーの設定やトレーニングコマンド実行を支援する組み込みAIアシスタント(
areno agent)を搭載。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト