Accio-Lab/Dressage
Scalable RL for Any Agent and Sandbox.
解決的問題
Dressage 是一個專為與真實世界工具(如程式碼編輯器、Shell 和 API)互動的 LLM 代理所設計的可擴展強化學習(RL)訓練框架。它解決了在隔離沙箱中策略展開與訓練流程之間的斷層問題,無論代理是「白盒」Python 迴圈還是「黑盒」HTTP 基礎代理,皆能確保完整的 RL 梯度流。
工作原理
Dressage 作為基於 slime 框架建構的訓練基礎與代理執行環境之間的橋樑。採用三層架構:
- Paddocks:管理互動語義,處理代理呼叫工具或與 HTTP 伺服器互動的方式。
- Sandboxes:提供工具執行的隔離,支援本地 bubblewrap 池或遠端 E2B 沙箱。
- Inference Proxy:位於代理與推理引擎(SGLang)之間,以細粒度記錄每個 token、logprob 和 loss mask,確保訓練資料準確且無重分詞漂移(透過名為 TITO 的系統實現)。
適用對象
專為訓練 LLM 代理在軟體工程(SWE)或一般工具使用環境中執行複雜任務的 AI 研究人員與開發者設計,適用於需要可擴展 RL 與安全沙箱的場景。
核心亮點
- 通用代理支援:相容「白盒」Python 代理與 Claude Code、OpenClaw、Codex 等「黑盒」代理。
- 細粒度精度:採用 Token-In-Token-Out(TITO)避免重分詞漂移,並支援 MoE 路由回放(R3)。
- 段落感知訓練:將軌跡段擴展為訓練樣本,以最大化從歷史壓縮或工具模式變更中學習的效果。
- 可插拔隔離:無縫切換本地 bubblewrap 與遠端 E2B 沙箱。
- 生產就緒的安全性:包含原子化軌跡日誌與上下文溢出偵測,防止訓練資料損壞。
相關
- 專案
- Dispatch
保持 Token 流動:來自 16 個開源 RL 庫的教訓Hugging Face 調查了 16 個開源 RL 庫,發現非同步 RL 訓練將推理與訓練分離到不同的 GPU 池、使用 rollout 緩衝區,並以非同步方式推送權重;Ray 在協調層占主導,NCCL 廣播是常見的權重同步方法。
- 專案
vndee/llm-sandboxLLM Sandbox 是一個 Python 套件,可在隔離的容器(Docker、Kubernetes 或 Podman)中執行大型語言模型生成的程式碼。支援多種語言,強制執行安全策略,可捕獲輸出圖表,提供互動式筆記本風格會話,並包含容器池系統以實現快速並行執行。
- 專案
redai-infra/RelaxRelax 是一個基於 Ray Serve 的開源強化學習引擎,專為後訓練多模態大語言模型設計。它將 rollout、actor 和 critic 解耦為獨立服務,支援完全非同步或混合執行,提供彈性擴展、豐富的 RL 算法集以及生產級運維功能。倉儲包含 Docker 鏡像、文字、視覺-語言和全模態任務的快速啟動腳本,以及詳盡的文件。
- 專案
huisezhiyin/sdd-riperSDD‑RIPER Light is a lightweight, repo‑native framework that adds a control plane around LLM‑based coding agents. It defines a clear loop—restating goals, creating a minimal spec, awaiting human approval, executing, validating with evidence, and syncing results back—so agents can modify code safely, auditable and recoverable. Four modular “skills” (light, strict, codemap, new‑chat‑ready) cover daily work, high‑risk tasks, unfamiliar codebases, and hand‑offs.