XYZ-AI-Lab/axrl
AxisRL is an agentic RL post-training framework built on SGLang rollout, Megatron training, and real-world agent workflows.
解決的問題
AxisRL 是為代理型強化學習(RL)後訓練所設計,模型必須在多回合中與環境互動、呼叫工具,並根據長期結果獲得獎勵。它解決了管理多回合回放、環境狀態、工具呼叫與權重同步的協調挑戰,同時確保訓練過程穩定且可觀測。
如何運作
AxisRL 作為一個系統層,連結高吞吐量的回放引擎(SGLang)與大規模分散式訓練引擎(Megatron)。它管理一個循環:回放代理執行代理工作流程,SGLang 工作者產生文字,環境產生獎勵,Megatron 工作者執行策略最佳化(如 PPO 或 GRPO)。
關鍵技術機制包括:
- 白箱與黑箱整合:支援內部代理迴圈(白箱)或透過 OpenAI 相容代理捕捉外部框架的互動(黑箱)。
- 部分回放:允許已完成的樣本立即傳送至訓練器,以減少因長尾軌跡延遲所造成的閒置時間。
- 基於句柄的資料平面:透過句柄而非中央驅動程式傳輸大型資料(如 MoE 路由資料),以避免瓶頸。
- 上下文管理:使用前綴樹合併與 MagiAttention,優化多回合情境中的重複注意力運算。
- 一致性工具:包含不匹配分析與「脈衝重播」,用於調試回放與訓練器執行路徑之間的差異。
適用對象
適用於訓練大型代理型 LLM(數百億參數)的研究人員與工程師,這些模型需要複雜的多回合互動與高吞吐量 RL 後訓練。
主要特色
- 基於 SGLang 實作回放,基於 Megatron 實作分散式訓練。
- 支援多種最佳化目標,包括 PPO、GRPO/GRPO2、GSPO、TOPR 與 TIS。
- 可處理超過 300 回合的軌跡。
- 提供 Rollout Routing Replay(R3)以在訓練期間穩定 MoE 專家路由。
- 提供可重現的除錯套件,用於分析損失突增與 token 級別不匹配。
相關
- 專案
- 專案
- 專案
- 專案
- 專案