Accio-Lab/Dressage

Scalable RL for Any Agent and Sandbox.

何を解決するか

Dressage は、実世界のツール(コードエディタ、シェル、API など)と対話する LLM エージェント専用に設計されたスケーラブルな強化学習(RL)フレームワークです。隔離されたサンドボックスでのポリシー展開とトレーニングプロセスのギャップを埋める困難を解決し、エージェントが「ホワイトボックス」の Python ループであろうと「ブラックボックス」の HTTP ベースエージェントであろうと、完全な RL グラデントフローを保証します。

仕組み

Dressage は、トレーニング基盤(slime フレームワーク上に構築)とエージェントの実行環境の間のブリッジとして機能します。3層アーキテクチャを採用しています:

  • Paddocks:インタラクションの意味論を管理し、エージェントがツールを呼び出す方法や HTTP サーバーとやり取りする方法を処理します。
  • Sandboxes:ツール実行の隔離を提供し、ローカルの bubblewrap プールまたはリモートの E2B サンドボックスの両方をサポートします。
  • Inference Proxy:エージェントと推論エンジン(SGLang)の間に配置され、各トークン、logprob、loss mask を細かく記録することで、トレーニングデータの正確性を確保し、リトークン化ドリフト(TITO と呼ばれるシステムにより)を回避します。

対象ユーザー

ソフトウェア工学(SWE)や一般的なツール利用環境で複雑なタスクを実行する LLM エージェントをトレーニングする AI リサーチャーや開発者向けに設計されています。スケーラブルな RL とセキュアなサンドボックス化が必要な場面に最適です。

特徴

  • ユニバーサルエージェント対応:ホワイトボックスの Python エージェントと、Claude Code、OpenClaw、Codex などのブラックボックスエージェントの両方に対応。
  • トークン単位の精度:TITO(Token-In-Token-Out)を用いてリトークン化ドリフトを回避し、MoE ルーティングリプレイ(R3)をサポート。
  • セグメント認識トレーニング:履歴圧縮やツールスキーマの変更から学習を最大化するために、トラジェクトリセグメントをトレーニングサンプルに拡張。
  • プラグイン可能な隔離:ローカルの bubblewrap とリモートの E2B サンドボックスの間をスムーズに切り替え可能。
  • プロダクション対応のセーフティ:アトミックなトラジェクトリーロギングとコンテキストオーバーフロー検出を備え、トレーニングデータの破損を防止。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト