yongliang-wu/DFT

[ICLR 2026] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification.

解決する課題

標準的な教師あり微調整(SFT)は、強化学習(RL)と比較して汎化性能が限定的であることがよくあります。このプロジェクトは、標準的なSFTの勾配に暗黙的にエンコードされている問題のある報酬構造に対処することで、大規模言語モデル(LLM)の汎化能力を向上させるように設計された手法であるDynamic Fine-Tuning(DFT)を実装します。

仕組み

DFTは、SFTの目的関数に対する単純な修正です。各トークンの損失をその予測確率によって動的に再スケーリングすることで、各トークンの勾配更新を安定化させます(確率自体を介したバックプロパゲーションを防ぐため、勾配フローからは切り離されています)。

対象者

LLMの微調整に取り組んでいる研究者や開発者、特に数学的推論、複雑なコーディング問題、および複数の有効な推論パス(非決定論的軌跡)が存在するマルチモーダル推論に焦点を当てている方に適しています。

ハイライト

  • 1行の実装: コアロジックは、標準的なSFTの損失計算に対する1行のコード変更です。
  • 汎化性能の向上: 複数の困難なベンチマークおよびベースモデルにおいて、標準的なSFTを上回ります。
  • RLに近い利点: オフラインRL設定に対する、効果的かつよりシンプルな代替案を提供します。
  • 幅広い統合: Hugging Face TRL、LLaMA-Factory、ms-swiftなどの人気ライブラリですでにサポートされています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch