microsoft/agent-lightning

The absolute trainer to light up AI agents.

何を解決するか

Agent Lightning は、AIエージェントを強化学習(RL)で訓練するための軽量なフレームワークです。エージェントの既存コードやハーネスに大きな変更を加えることなく、RLを活用できます。複雑なエージェントワークフロー(ツール、コンテキスト、制御フロー)を、モデルのパフォーマンスに基づいて更新するトレーニングループに統合する難しさを解決します。

動作方法

このフレームワークは、エージェントの環境とトレーナーの間を橋渡しする3つのコンポーネントアーキテクチャを使用しています:

  • トレーナー: verl と vLLM を使ってトレーニングサンプルを構築し、モデルポリシーを更新するRLプロセスを管理します。
  • APIゲートウェイ: モデルリクエストのプロキシとして機能し、インタラクションとトラジェクトリをキャプチャしてトレーニングデータとして利用します。
  • ロールアウトコントローラー: エージェントをローカルまたはKubernetes Jobとして起動・管理し、実世界の環境と相互作用できるようにします。

対象ユーザー

特定の分野(コード生成、検索、数学的推論など)におけるパフォーマンス向上のために、強化学習を適用したい自律エージェントを開発している研究者や開発者。

特徴

  • 最小限のコード変更: プロキシを通じて実際のハーネスでエージェントを訓練可能。エージェントのロジックに一切変更不要。
  • 軽量設計: フレームワーク全体は約3,500行のコードで構成。
  • Kubernetesネイティブ: エージェントをKubernetes Jobとして実行し、スケーラブルなロールアウト収集をサポート。
  • 実証された成果: Qwen3.5-9Bコードエージェントにおいて、わずか6KのトレーニングサンプルでSWE-bench Verifiedで14.6ポイントの向上を達成。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト