Accio-Lab/Dressage

Scalable RL for Any Agent and Sandbox.

해결하는 문제

Dressage는 실제 도구(예: 코드 에디터, 셸, API 등)와 상호작용하는 LLM 에이전트를 위한 확장 가능한 강화학습(RL) 프레임워크입니다. 격리된 사전에서의 정책 전개와 학습 프로세스 사이의 격차를 해결하여, 에이전트가 '화이트박스' 파이썬 루프이든 '블랙박스' HTTP 기반 에이전트이든 관계없이 완전한 RL 그래디언트 흐름을 보장합니다.

작동 방식

Dressage는 트레이닝 기반(기반 프레임워크: slime)과 에이전트 실행 환경 사이의 다리 역할을 합니다. 3계층 아키텍처를 사용합니다:

  • Paddocks: 에이전트가 도구를 호출하거나 HTTP 서버와 상호작용하는 방식을 관리하는 인터랙션 의미론을 처리합니다.
  • Sandboxes: 도구 실행을 위한 격리 환경을 제공하며, 로컬의 bubblewrap 풀 또는 원격의 E2B 사전을 모두 지원합니다.
  • Inference Proxy: 에이전트와 추론 엔진(SGLang) 사이에 위치하여, 토큰, logprob, loss mask를 세밀하게 기록함으로써 학습 데이터의 정확성을 보장하고, 리토큰화 드리프트를 방지합니다(TITO 시스템을 통해).

대상 사용자

소프트웨어 공학(SWE) 또는 일반적인 도구 사용 환경에서 복잡한 작업을 수행하는 LLM 에이전트를 학습하는 AI 연구자 및 개발자에게 적합합니다. 확장 가능한 RL과 안전한 사전 격리가 필요한 경우에 최적입니다.

주요 특징

  • 유니버설 에이전트 지원: '화이트박스' 파이썬 에이전트와 Claude Code, OpenClaw, Codex와 같은 '블랙박스' 에이전트 모두 지원.
  • 토큰 단위 정밀도: TITO(Token-In-Token-Out)를 사용해 리토큰화 드리프트를 방지하고, MoE 라우팅 리플레이(R3)를 지원합니다.
  • 세그먼트 인식 학습: 역사 압축 또는 도구 스키마 변경에서 최대한의 학습을 위해 트래잭토리 세그먼트를 학습 샘플로 확장합니다.
  • 플러그인 가능한 격리: 로컬 bubblewrap와 원격 E2B 사전 간을 원활하게 전환 가능합니다.
  • 프로덕션 준비된 안전성: 원자적 트래잭토리 로깅과 컨텍스트 오버플로우 탐지 기능을 포함하여 학습 데이터 손상 방지.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트