yongliang-wu/DFT
[ICLR 2026] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification.
해결하는 문제
표준적인 지도 미세 조정(SFT)은 강화 학습(RL)에 비해 일반화 성능이 제한적인 경우가 많습니다. 이 프로젝트는 표준 SFT 그래디언트에 암묵적으로 인코딩된 문제 있는 보상 구조를 해결함으로써 대규모 언어 모델(LLM)의 일반화 능력을 향상시키도록 설계된 Dynamic Fine-Tuning(DFT)을 구현합니다.
작동 원리
DFT는 SFT 목적 함수에 대한 간단한 수정입니다. 각 토큰의 손실을 예측 확률에 따라 동적으로 재스케일링하여 각 토큰의 그래디언트 업데이트를 안정화합니다(확률 자체를 통한 역전파를 방지하기 위해 그래디언트 흐름에서 분리됨).
대상자
LLM 미세 조정 작업을 수행하는 연구자와 개발자, 특히 수학적 추론, 복잡한 코딩 문제 및 여러 유효한 추론 경로(비결정론적 궤적)가 존재하는 멀티모달 추론에 집중하는 분들에게 적합합니다.
주요 특징
- 한 줄 구현: 핵심 로직은 표준 SFT 손실 계산에 대한 단 한 줄의 코드 변경입니다.
- 향상된 일반화: 여러 까다로운 벤치마크 및 베이스 모델에서 표준 SFT보다 뛰어난 성능을 보입니다.
- RL과 유사한 이점: 오프라인 RL 설정에 대한 효과적이고 더 단순한 대안을 제공합니다.
- 폭넓은 통합: Hugging Face TRL, LLaMA-Factory, ms-swift와 같은 인기 라이브러리에서 이미 지원됩니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch