inclusionAI/AReno

An easy-to-use, fast toolkit to scale up RL post-training on a single node.

何を解決するか

ARenoは、LLM強化学習(RL)およびポストトレーニングを、自己完結型の単一ノードツールキットとして利用可能にするように設計されています。複雑なクラスタ設定や、別々の推論サーバー、断片化されたトレーニングフレームワークの必要性を排除し、開発者が1台のマシン上でベースモデルのチェックポイントからトレーニング済みモデルのデプロイまでを実行できるようにします。

動作方法

ARenoは単一ノードのパフォーマンス最適化を目的としたフルスタック設計を採用しています。TrainerクラスとCLIを提供し、RLループ全体を処理します:オンポリシーの完了生成(ロールアウト)、ユーザー定義の報酬関数によるスコアリング、モデル重みの更新(トレーニング)。CUDA(Linux)およびMLX(Apple Silicon)の両バックエンドをネイティブでサポートしています。

対象ユーザー

大規模インフラストラクチャの管理負荷なしに、RL、SFT、またはDPOスタイルのトレーニングを使って、迅速かつローカルでLLMのポストトレーニングを実行したい研究者や開発者向けです。

特徴

  • 即插即用--algoフラグまたはPython APIで、さまざまなポストトレーニングアルゴリズムに簡単にアクセス可能。
  • エージェント型RL対応:ローカルのOpenAI互換プロキシと対話するエージェントのトレーニングをサポートし、トラジェクトリから学習可能。
  • マルチモーダル対応:OpenAIスタイルのメッセージフォーマットを使用して、画像、音声、動画コンテンツに対応。
  • ハードウェアの柔軟性:NVIDIA GPUはCUDA、Apple SiliconはMLXでネイティブサポート。
  • 統合型サービング:連続バッチ処理を備えた組み込みOpenAI互換サーバーを提供し、トレーニング済みモデルを即座にデプロイ可能。
  • オペレーションエージェント:ユーザーの設定やトレーニングコマンド実行を支援する組み込みAIアシスタント(areno agent)を搭載。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト