radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

解决的问题

Miles 专为大规模模型后训练设计,特别解决了在万亿参数规模下强化学习(RL)所面临的不稳定性与性能瓶颈问题。它提供了一个企业级框架,能够处理高吞吐量的推理需求和大规模训练,同时确保数值稳定性和容错能力。

工作原理

Miles 通过解耦推理与训练工作节点,实现完全异步的强化学习。它使用 SGLang 进行高吞吐量生成(推理),使用 Megatron-LM(或 PyTorch FSDP2)进行可扩展训练。为保持效率,它实现了 P2P RDMA 以在解耦架构中实现快速权重更新,并支持低精度训练(MXFP8、NVFP4、INT4 QAT),以降低内存和计算开销。

适用对象

适用于使用 GRPO、PPO 和 REINFORCE++ 等强化学习方法训练前沿规模模型(如 DeepSeek-V4、Kimi-K3 或 Nemotron 3 Ultra)的模型实验室、硬件与云服务提供商以及研究人员。

核心亮点

  • 完全异步 RL: 解耦推理与训练,最小化空闲时间,支持可配置的在线与离线策略调度。
  • 逐令牌输入输出(TITO): 消除推理与训练之间所需的解码/重编码往返通信。
  • 推理路由重放(R3): 通过在训练器前向传播中重放专家路由,防止 MoE 路由不匹配。
  • 广泛硬件支持: 通过 ROCm 兼容 NVIDIA(H100、B200 等)和 AMD(MI300X、MI355X)GPU。
  • 智能体环境集成: 可连接 E2B 和 Modal 等沙箱环境,用于训练代码生成与计算机使用智能体。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目