THUDM/slime

slime is an LLM post-training framework for RL Scaling.

What it solves

slime은 RL (Reinforcement Learning) 스케일링을 위해 설계된 LLM 사후 학습(post-training) 프레임워크입니다. 이 프레임워크는 고성능 학습과 유연한 데이터 생성을 하나의 간소화된 데이터 흐름으로 통합함으로써, 분리된 트레이너, 롤아웃 서비스, 에이전트 프레임워크를 관리하는 복잡성을 해결합니다.

How it works

slime은 Megatron (학습용)과 SGLang (롤아웃/추론용)을 연결합니다. 추상화 계층을 추가하지 않고도 사용자가 상류 엔진의 네이티브 인자를 모두 사용할 수 있도록 하는 "pass-through" 설계를 사용합니다. 시스템은 세 가지 주요 모듈로 구성됩니다:

  • Training (Megatron): 메인 학습 프로세스를 처리하고 파라미터를 롤아웃 모듈로 동기화합니다.
  • Rollout (SGLang + router): 보상(rewards) 및 검증기(verifier) 출력을 포함한 새로운 데이터를 생성하며, 이는 멀티턴 루프나 도구 호출을 위한 커스텀 함수로 확장할 수 있습니다.
  • Data Buffer: 프롬프트 초기화 및 생성된 샘플의 흐름을 관리하는 브리지 역할을 합니다.

Who it’s for

이 프레임워크는 프론티어 모델(GLM, Qwen, DeepSeek, Llama 시리즈 등)에 대해 대규모 RL 사후 학습을 수행하는 연구자와 엔지니어, 그리고 샌드박스, 검증기 또는 멀티모달 상호작용을 포함하는 에이전트 기반 RL 워크플로우를 구축하는 사람들을 대상으로 합니다.

Highlights

  • Production Validated: GLM 제품군(GLM-4.5부터 GLM-5.3까지)의 학습에 사용되었습니다.
  • Native Engine Integration: Megatron 및 SGLang 인자에 대한 직접적인 pass-through를 지원하여 상류 엔진의 최적화 기능을 즉시 사용할 수 있습니다.
  • Agentic Flexibility: 학습 커널을 수정하지 않고도 멀티 에이전트 시스템, 검색/RAG, 샌드박스 코딩 에이전트 등 복잡한 데이터 생성 워크플로우를를 지원합니다.
  • Advanced Deployment: PD (Prefill-Decode) 분리, 효율적인 업데이트를 위한 델타 가중치 동기화, 외부 롤아웃 엔진 지원을 특징으로 합니다.
  • Engineering Rigor: 포괄적인 CI, GPU 엔드투엔드 테스트, 트레이싱 및 프로파일링을 위한 전용 도구를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트