Accio-Lab/Dressage

Scalable RL for Any Agent and Sandbox.

解決的問題

Dressage 是一個專為與真實世界工具(如程式碼編輯器、Shell 和 API)互動的 LLM 代理所設計的可擴展強化學習(RL)訓練框架。它解決了在隔離沙箱中策略展開與訓練流程之間的斷層問題,無論代理是「白盒」Python 迴圈還是「黑盒」HTTP 基礎代理,皆能確保完整的 RL 梯度流。

工作原理

Dressage 作為基於 slime 框架建構的訓練基礎與代理執行環境之間的橋樑。採用三層架構:

  • Paddocks:管理互動語義,處理代理呼叫工具或與 HTTP 伺服器互動的方式。
  • Sandboxes:提供工具執行的隔離,支援本地 bubblewrap 池或遠端 E2B 沙箱。
  • Inference Proxy:位於代理與推理引擎(SGLang)之間,以細粒度記錄每個 token、logprob 和 loss mask,確保訓練資料準確且無重分詞漂移(透過名為 TITO 的系統實現)。

適用對象

專為訓練 LLM 代理在軟體工程(SWE)或一般工具使用環境中執行複雜任務的 AI 研究人員與開發者設計,適用於需要可擴展 RL 與安全沙箱的場景。

核心亮點

  • 通用代理支援:相容「白盒」Python 代理與 Claude Code、OpenClaw、Codex 等「黑盒」代理。
  • 細粒度精度:採用 Token-In-Token-Out(TITO)避免重分詞漂移,並支援 MoE 路由回放(R3)。
  • 段落感知訓練:將軌跡段擴展為訓練樣本,以最大化從歷史壓縮或工具模式變更中學習的效果。
  • 可插拔隔離:無縫切換本地 bubblewrap 與遠端 E2B 沙箱。
  • 生產就緒的安全性:包含原子化軌跡日誌與上下文溢出偵測,防止訓練資料損壞。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案