radixark/miles
Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.
해결하는 문제
Miles는 대규모 모델의 후처리 학습을 위해 설계되었으며, 트리리언 파라미터 규모에서 발생하는 강화학습(RL)의 불안정성과 성능 병목 문제를 특별히 해결합니다. 고스루풋을 요구하는 로울아웃과 대규모 학습을 처리할 수 있는 기업용 프레임워크를 제공하며, 수치적 안정성과 장애 내성도 보장합니다.
작동 방식
Miles는 로울아웃과 학습 워커를 분리하여 완전한 비동기 강화학습을 가능하게 합니다. 고스루풋 생성(로울아웃)에는 SGLang을, 확장 가능한 학습에는 Megatron-LM(또는 PyTorch FSDP2)을 사용합니다. 효율성을 유지하기 위해, 분리된 환경 간 빠른 가중치 업데이트를 위한 P2P RDMA를 구현하고, 메모리와 계산 오버헤드를 줄이기 위해 저정밀도 학습(MXFP8, NVFP4, INT4 QAT)을 지원합니다.
대상 사용자
GRPO, PPO, REINFORCE++와 같은 RL 레시피를 사용하여 DeepSeek-V4, Kimi-K3, Nemotron 3 Ultra와 같은 프론티어 규모 모델을 학습하는 모델 랩, 하드웨어 및 클라우드 제공업체, 연구자들을 위한 것입니다.
주요 특징
- 완전한 비동기 RL: 로울아웃과 학습을 분리하여 버블을 최소화하고, 온폴리시 및 오프폴리시 스케줄을 구성 가능하게 합니다.
- 토큰 인 토큰 아웃(TITO): 로울아웃과 학습 간의 디토큰화/리토큰화 라운드트립이 필요 없도록 합니다.
- 로울아웃 라우팅 리플레이(R3): 트레이너의 포워드 패스에서 전문가 라우팅을 재실행하여 MoE 라우팅 불일치를 방지합니다.
- 광범위한 하드웨어 지원: ROCm을 통해 NVIDIA(H100, B200 등) 및 AMD(MI300X, MI355X) GPU와 호환됩니다.
- 에이전트 환경 통합: E2B 및 Modal과 같은 사전 환경과 연결하여 코드 생성 및 컴퓨터 사용 에이전트의 학습을 가능하게 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트