Accio-Lab/Dressage
Scalable RL for Any Agent and Sandbox.
解决的问题
Dressage 是一个专为与真实世界工具(如代码编辑器、Shell 和 API)交互的 LLM 代理设计的可扩展强化学习(RL)训练框架。它解决了在隔离沙箱中的策略展开与训练过程之间存在的鸿沟问题,无论代理是“白盒”Python 循环还是“黑盒”HTTP 基础代理,都能确保完整的 RL 梯度流。
工作原理
Dressage 作为基于 slime 框架构建的训练基础与代理执行环境之间的桥梁。采用三层架构:
- Paddocks:管理交互语义,处理代理调用工具或与 HTTP 服务器交互的方式。
- Sandboxes:提供工具执行的隔离,支持本地 bubblewrap 池或远程 E2B 沙箱。
- Inference Proxy:位于代理与推理引擎(SGLang)之间,以细粒度记录每个 token、logprob 和 loss mask,确保训练数据准确且无重分词漂移(通过名为 TITO 的系统实现)。
适用人群
专为训练 LLM 代理在软件工程(SWE)或通用工具使用环境中执行复杂任务的 AI 研究人员和开发者设计,适用于需要可扩展 RL 和安全沙箱的场景。
核心亮点
- 通用代理支持:兼容“白盒”Python 代理和 Claude Code、OpenClaw、Codex 等“黑盒”代理。
- 细粒度精度:采用 Token-In-Token-Out(TITO)避免重分词漂移,并支持 MoE 路由回放(R3)。
- 段落感知训练:将轨迹段扩展为训练样本,以最大化从历史压缩或工具模式变更中学习的效果。
- 可插拔隔离:无缝切换本地 bubblewrap 与远程 E2B 沙箱。
- 生产就绪的安全性:包含原子化轨迹日志和上下文溢出检测,防止训练数据损坏。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目