XYZ-AI-Lab/axrl
AxisRL is an agentic RL post-training framework built on SGLang rollout, Megatron training, and real-world agent workflows.
解决的问题
AxisRL 专为代理型强化学习(RL)后训练设计,模型需在多轮交互中与环境进行交互、调用工具,并根据长期结果获得奖励。它解决了管理多轮回放、环境状态、工具调用和权重同步的协调挑战,同时确保训练过程稳定且可观察。
工作原理
AxisRL 作为一个系统层,连接高吞吐量回放引擎(SGLang)与大规模分布式训练引擎(Megatron)。它管理一个循环:回放代理执行代理工作流,SGLang 工作者生成文本,环境产生奖励,Megatron 工作者执行策略优化(如 PPO 或 GRPO)。
关键技术机制包括:
- 白盒与黑盒集成:支持内部代理循环(白盒)或通过 OpenAI 兼容代理捕获外部框架的交互(黑盒)。
- 部分回放:允许已完成的样本立即发送给训练器,以减少因长尾轨迹延迟导致的空闲时间。
- 基于句柄的数据平面:通过句柄而非中央驱动程序传输重型数据(如 MoE 路由数据),以避免瓶颈。
- 上下文管理:使用前缀树合并和 MagiAttention 优化多轮上下文中的重复注意力计算。
- 一致性工具:包含不匹配分析和「脉冲重播」,用于调试回放与训练器执行路径之间的偏差。
适用人群
适用于训练大规模代理型 LLM(数百亿参数)的研究人员和工程师,这些模型需要复杂的多轮交互和高吞吐量 RL 后训练。
主要亮点
- 基于 SGLang 实现回放,基于 Megatron 实现分布式训练。
- 支持多种优化目标,包括 PPO、GRPO/GRPO2、GSPO、TOPR 和 TIS。
- 可处理超过 300 轮的轨迹。
- 提供 Rollout Routing Replay(R3)以在训练期间稳定 MoE 专家路由。
- 提供可复现的调试套件,用于分析损失突增和 token 级别不匹配。
相关
- 项目
- 项目
- 项目
- 项目
- 项目