yongliang-wu/DFT
[ICLR 2026] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification.
解决的问题
标准的监督微调(SFT)与强化学习(RL)相比,往往存在泛化能力有限的问题。本项目实现了动态微调(DFT),这是一种旨在通过解决标准 SFT 梯度中隐式编码的有问题的奖励结构,来提高大语言模型(LLM)泛化能力的方法。
工作原理
DFT 是对 SFT 目标函数的一个简单修改。它通过根据每个 Token 的预测概率动态地重新缩放每个 Token 的损失,从而稳定梯度更新(该概率与梯度流分离,以防止通过概率本身进行反向传播)。
适用对象
从事 LLM 微调工作的研究人员和开发人员,特别是专注于数学推理、复杂编程问题以及存在多种有效推理路径(非确定性轨迹)的多模态推理领域的人士。
亮点
- 单行实现:核心逻辑是对标准 SFT 损失计算的一次单行代码修改。
- 改进的泛化能力:在多个具有挑战性的基准测试和基础模型上优于标准 SFT。
- 类 RL 的优势:为离线 RL 设置提供了一种有效且更简单的替代方案。
- 广泛集成:已被 Hugging Face TRL、LLaMA-Factory 和 ms-swift 等流行库支持。
相关
- 项目
- 项目
- Dispatch
- 项目
- Dispatch