radixark/miles
Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.
何を解決するか
Miles は大規模モデルの後処理学習を目的として設計されており、トリアン・パラメータスケールにおける強化学習(RL)に関連する不安定性とパフォーマンスのボトルネックを特に解決します。高スループットのロールアウトと大規模な学習を処理できる企業向けのフレームワークを提供し、数値的安定性と障害耐性を確保します。
動作方法
Miles はロールアウトとトレーニングのワーカーを分離することで、完全な非同期強化学習を実現します。高スループット生成(ロールアウト)には SGLang を、スケーラブルなトレーニングには Megatron-LM(または PyTorch FSDP2)を使用します。効率を維持するために、非統合環境間での高速な重み更新を実現する P2P RDMA を実装し、メモリと計算のオーバーヘッドを削減するための低精度学習(MXFP8、NVFP4、INT4 QAT)もサポートしています。
対象ユーザー
DeepSeek-V4、Kimi-K3、Nemotron 3 Ultra などのフロンティアスケールモデルを GRPO、PPO、REINFORCE++ などの RL レシピで学習している、モデルラボ、ハードウェアおよびクラウドプロバイダー、研究者向けです。
主な特徴
- 完全な非同期 RL: ロールアウトとトレーニングを分離し、バブルを最小限に抑え、オンポリシーおよびオフポリシーのスケジュールをカスタマイズ可能にします。
- トークンイントークンアウト(TITO): ロールアウトとトレーニング間のデトークン化/リトークン化のラウンドトリップを不要にします。
- ロールアウトルーティングリプレイ(R3): トレーナーのフォワードパスでエキスパートルーティングを再実行することで、MoE ルーティングの不一致を防止します。
- 広範なハードウェア対応: NVIDIA(H100、B200 など)および AMD(MI300X、MI355X)GPU に対応し、ROCm を介して利用可能。
- エージェント環境の統合: E2B や Modal などのサンドボックスと接続し、コード作成およびコンピュータ利用エージェントの学習を可能にします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト