yongliang-wu/DFT

[ICLR 2026] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification.

解決的問題

標準的監督式微調(SFT)與強化學習(RL)相比,往往存在泛化能力有限的問題。本專案實現了動態微調(DFT),這是一種旨在透過解決標準 SFT 梯度中隱含的具問題的獎勵結構,來提高大型語言模型(LLM)泛化能力的方法。

工作原理

DFT 是對 SFT 目標函數的一個簡單修改。它透過根據每個 Token 的預測機率動態地重新縮放每個 Token 的損失,從而穩定梯度更新(該機率與梯度流分離,以防止透過機率本身進行反向傳播)。

適用對象

從事 LLM 微調工作的研究人員和開發人員,特別是專注於數學推理、複雜編碼問題以及存在多種有效推理路徑(非決定性軌跡)的多模態推理領域的人士。

亮點

  • 單行實現:核心邏輯是對標準 SFT 損失計算的一次單行程式碼修改。
  • 改進的泛化能力:在多個具挑戰性的基準測試和基礎模型上優於標準 SFT。
  • 類 RL 的優勢:為離線 RL 設定提供了一種有效且更簡單的替代方案。
  • 廣泛整合:已被 Hugging Face TRL、LLaMA-Factory 和 ms-swift 等流行函式庫支援。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • Dispatch