radixark/miles
Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.
解決的問題
Miles 是專為大規模模型後訓練設計,特別解決在兆兆參數規模下強化學習(RL)所面臨的不穩定性與效能瓶頸。它提供企業級框架,可處理高吞吐量的推論需求與大規模訓練,同時確保數值穩定性與容錯能力。
工作原理
Miles 透過解耦推論與訓練工作節點,實現完全非同步的強化學習。它使用 SGLang 進行高吞吐量生成(推論),使用 Megatron-LM(或 PyTorch FSDP2)進行可擴展訓練。為維持效率,它實作 P2P RDMA 以在解耦架構中實現快速權重更新,並支援低精度訓練(MXFP8、NVFP4、INT4 QAT),以降低記憶體與運算開銷。
適用對象
適用於使用 GRPO、PPO 和 REINFORCE++ 等強化學習方法訓練前沿規模模型(如 DeepSeek-V4、Kimi-K3 或 Nemotron 3 Ultra)的模型實驗室、硬體與雲端服務供應商以及研究人員。
核心亮點
- 完全非同步 RL: 解耦推論與訓練,最小化空閒時間,支援可配置的線上與離線策略排程。
- 逐令牌輸入輸出(TITO): 消除推論與訓練之間所需的解碼/重編碼往返通訊。
- 推論路由重放(R3): 透過在訓練器前向傳播中重放專家路由,防止 MoE 路由不匹配。
- 廣泛硬體支援: 透過 ROCm 兼容 NVIDIA(H100、B200 等)與 AMD(MI300X、MI355X)GPU。
- 智能體環境整合: 可連接 E2B 和 Modal 等沙箱環境,用於訓練程式碼生成與電腦使用智能體。
相關
- 專案
- 專案
- 專案
- 專案
- 專案