microsoft/agent-lightning
The absolute trainer to light up AI agents.
何を解決するか
Agent Lightning は、AIエージェントを強化学習(RL)で訓練するための軽量なフレームワークです。エージェントの既存コードやハーネスに大きな変更を加えることなく、RLを活用できます。複雑なエージェントワークフロー(ツール、コンテキスト、制御フロー)を、モデルのパフォーマンスに基づいて更新するトレーニングループに統合する難しさを解決します。
動作方法
このフレームワークは、エージェントの環境とトレーナーの間を橋渡しする3つのコンポーネントアーキテクチャを使用しています:
- トレーナー:
verlと vLLM を使ってトレーニングサンプルを構築し、モデルポリシーを更新するRLプロセスを管理します。 - APIゲートウェイ: モデルリクエストのプロキシとして機能し、インタラクションとトラジェクトリをキャプチャしてトレーニングデータとして利用します。
- ロールアウトコントローラー: エージェントをローカルまたはKubernetes Jobとして起動・管理し、実世界の環境と相互作用できるようにします。
対象ユーザー
特定の分野(コード生成、検索、数学的推論など)におけるパフォーマンス向上のために、強化学習を適用したい自律エージェントを開発している研究者や開発者。
特徴
- 最小限のコード変更: プロキシを通じて実際のハーネスでエージェントを訓練可能。エージェントのロジックに一切変更不要。
- 軽量設計: フレームワーク全体は約3,500行のコードで構成。
- Kubernetesネイティブ: エージェントをKubernetes Jobとして実行し、スケーラブルなロールアウト収集をサポート。
- 実証された成果: Qwen3.5-9Bコードエージェントにおいて、わずか6KのトレーニングサンプルでSWE-bench Verifiedで14.6ポイントの向上を達成。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト