Accio-Lab/Dressage
Scalable RL for Any Agent and Sandbox.
何を解決するか
Dressage は、実世界のツール(コードエディタ、シェル、API など)と対話する LLM エージェント専用に設計されたスケーラブルな強化学習(RL)フレームワークです。隔離されたサンドボックスでのポリシー展開とトレーニングプロセスのギャップを埋める困難を解決し、エージェントが「ホワイトボックス」の Python ループであろうと「ブラックボックス」の HTTP ベースエージェントであろうと、完全な RL グラデントフローを保証します。
仕組み
Dressage は、トレーニング基盤(slime フレームワーク上に構築)とエージェントの実行環境の間のブリッジとして機能します。3層アーキテクチャを採用しています:
- Paddocks:インタラクションの意味論を管理し、エージェントがツールを呼び出す方法や HTTP サーバーとやり取りする方法を処理します。
- Sandboxes:ツール実行の隔離を提供し、ローカルの bubblewrap プールまたはリモートの E2B サンドボックスの両方をサポートします。
- Inference Proxy:エージェントと推論エンジン(SGLang)の間に配置され、各トークン、logprob、loss mask を細かく記録することで、トレーニングデータの正確性を確保し、リトークン化ドリフト(TITO と呼ばれるシステムにより)を回避します。
対象ユーザー
ソフトウェア工学(SWE)や一般的なツール利用環境で複雑なタスクを実行する LLM エージェントをトレーニングする AI リサーチャーや開発者向けに設計されています。スケーラブルな RL とセキュアなサンドボックス化が必要な場面に最適です。
特徴
- ユニバーサルエージェント対応:ホワイトボックスの Python エージェントと、Claude Code、OpenClaw、Codex などのブラックボックスエージェントの両方に対応。
- トークン単位の精度:TITO(Token-In-Token-Out)を用いてリトークン化ドリフトを回避し、MoE ルーティングリプレイ(R3)をサポート。
- セグメント認識トレーニング:履歴圧縮やツールスキーマの変更から学習を最大化するために、トラジェクトリセグメントをトレーニングサンプルに拡張。
- プラグイン可能な隔離:ローカルの bubblewrap とリモートの E2B サンドボックスの間をスムーズに切り替え可能。
- プロダクション対応のセーフティ:アトミックなトラジェクトリーロギングとコンテキストオーバーフロー検出を備え、トレーニングデータの破損を防止。
関連
- プロジェクト
SWE-bench/SWE-smithソフトウェアエンジニアリングエージェントのトレーニングデータと環境の作成をスケールさせるツールキットで、LLM が実際の GitHub Issue を解決できるようにトレーニングします。
- Dispatch
トークンを流し続けよう:16のオープンソースRLライブラリから得た教訓Hugging Face は 16 のオープンソース RL ライブラリを調査し、非同期 RL トレーニングは推論と学習を別々の GPU プールに分離し、ロールアウトバッファを使用し、重みを非同期にプッシュすることを示しました。オーケストレーションは Ray が支配的で、重み同期は NCCL ブロードキャストが一般的です。
- プロジェクト
vndee/llm-sandboxLLM Sandboxは、大規模言語モデルが生成したコードを、隔離されたコンテナ(Docker、Kubernetes、またはPodman)内で実行するPythonパッケージです。複数言語をサポートし、セキュリティポリシーを適用可能、出力のプロットをキャプチャ、インタラクティブなノートブックスタイルのセッションを提供し、高速かつ並列実行を可能にするコンテナプールシステムを備えています。
- プロジェクト
redai-infra/RelaxRelaxは、Ray Serveを基盤としたオープンソースの強化学習エンジンで、事後訓練されたマルチモーダルLLM向けです。ロールアウト、アクター、クリティックを独立したサービスに分離し、完全非同期またはハイブリッド実行をサポート。エラスティックスケーリング、豊富なRLアルゴリズム、プロダクションレベルの運用機能を備えています。リポジトリにはDockerイメージ、テキスト、ビジョン・ランゲージ、オムニモーダルタスク用のクイックスタートスクリプト、および詳細なドキュメントが含まれます。
- プロジェクト
huisezhiyin/sdd-riperSDD‑RIPER Light is a lightweight, repo‑native framework that adds a control plane around LLM‑based coding agents. It defines a clear loop—restating goals, creating a minimal spec, awaiting human approval, executing, validating with evidence, and syncing results back—so agents can modify code safely, auditable and recoverable. Four modular “skills” (light, strict, codemap, new‑chat‑ready) cover daily work, high‑risk tasks, unfamiliar codebases, and hand‑offs.