opendilab/LightRFT

LightRFT: Light, Efficient, Omni-modal & Reward-model Driven Reinforcement Fine-Tuning Framework

解决的问题

LightRFT 提供了一个高性能的基于人类反馈的强化学习(RLHF)和基于可验证奖励的强化学习(RLVR)框架。它通过高效的推理引擎、多样的优化算法和先进的内存管理,解决了大语言模型(LLMs)和视觉语言模型(VLMs)微调的复杂性和资源密集性问题,从而降低 GPU 开销。

工作原理

LightRFT 集成了 vLLM 和 SGLang 等高速推理后端,用于处理采样和生成。它采用多种策略优化算法(如 GRPO 和 GSPO)和优势估计技术,以优化模型行为。为最大化硬件效率,它采用“Colocate Anything”方法,允许奖励模型与训练模型共享同一 GPU 设备,并支持 FSDP v2 和 DeepSpeed ZeRO 等分布式训练策略。

适用人群

专为从事多模态模型对齐与强化学习的 AI 研究人员和开发者设计,特别适合希望为文本、视觉语言和语音语言任务实现复杂 RLHF/RLVR 流水线的用户。

主要亮点

  • 全模态支持:原生支持 LLM、VLM(如 Qwen-VL)以及语音-语言模型的训练流水线。
  • 多样算法套件:实现前沿方法,包括 GRPO、GSPO、DAPO 和 REINFORCE++。
  • 资源优化:支持 FP8 推理、引擎休眠/唤醒机制,以及奖励模型的共置,以最小化通信开销。
  • 可扩展基础设施:内置对 FSDP v2、DeepSpeed ZeRO(阶段 1-3)和混合精度训练(BF16/FP16)的支持。
  • 集成工具链:支持 Weights & Biases 集成和数学能力基准测试工具(GSM8K、Geo3K)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目