opendilab/LightRFT
LightRFT: Light, Efficient, Omni-modal & Reward-model Driven Reinforcement Fine-Tuning Framework
解决的问题
LightRFT 提供了一个高性能的基于人类反馈的强化学习(RLHF)和基于可验证奖励的强化学习(RLVR)框架。它通过高效的推理引擎、多样的优化算法和先进的内存管理,解决了大语言模型(LLMs)和视觉语言模型(VLMs)微调的复杂性和资源密集性问题,从而降低 GPU 开销。
工作原理
LightRFT 集成了 vLLM 和 SGLang 等高速推理后端,用于处理采样和生成。它采用多种策略优化算法(如 GRPO 和 GSPO)和优势估计技术,以优化模型行为。为最大化硬件效率,它采用“Colocate Anything”方法,允许奖励模型与训练模型共享同一 GPU 设备,并支持 FSDP v2 和 DeepSpeed ZeRO 等分布式训练策略。
适用人群
专为从事多模态模型对齐与强化学习的 AI 研究人员和开发者设计,特别适合希望为文本、视觉语言和语音语言任务实现复杂 RLHF/RLVR 流水线的用户。
主要亮点
- 全模态支持:原生支持 LLM、VLM(如 Qwen-VL)以及语音-语言模型的训练流水线。
- 多样算法套件:实现前沿方法,包括 GRPO、GSPO、DAPO 和 REINFORCE++。
- 资源优化:支持 FP8 推理、引擎休眠/唤醒机制,以及奖励模型的共置,以最小化通信开销。
- 可扩展基础设施:内置对 FSDP v2、DeepSpeed ZeRO(阶段 1-3)和混合精度训练(BF16/FP16)的支持。
- 集成工具链:支持 Weights & Biases 集成和数学能力基准测试工具(GSM8K、Geo3K)。
相关
- 项目
- 项目
- 项目
- 项目
- 项目