yongliang-wu/DFT
[ICLR 2026] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification.
解決する課題
標準的な教師あり微調整(SFT)は、強化学習(RL)と比較して汎化性能が限定的であることがよくあります。このプロジェクトは、標準的なSFTの勾配に暗黙的にエンコードされている問題のある報酬構造に対処することで、大規模言語モデル(LLM)の汎化能力を向上させるように設計された手法であるDynamic Fine-Tuning(DFT)を実装します。
仕組み
DFTは、SFTの目的関数に対する単純な修正です。各トークンの損失をその予測確率によって動的に再スケーリングすることで、各トークンの勾配更新を安定化させます(確率自体を介したバックプロパゲーションを防ぐため、勾配フローからは切り離されています)。
対象者
LLMの微調整に取り組んでいる研究者や開発者、特に数学的推論、複雑なコーディング問題、および複数の有効な推論パス(非決定論的軌跡)が存在するマルチモーダル推論に焦点を当てている方に適しています。
ハイライト
- 1行の実装: コアロジックは、標準的なSFTの損失計算に対する1行のコード変更です。
- 汎化性能の向上: 複数の困難なベンチマークおよびベースモデルにおいて、標準的なSFTを上回ります。
- RLに近い利点: オフラインRL設定に対する、効果的かつよりシンプルな代替案を提供します。
- 幅広い統合: Hugging Face TRL、LLaMA-Factory、ms-swiftなどの人気ライブラリですでにサポートされています。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch