Thinking-Space/Rethinking-OPD
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
解決的問題
本專案研究大語言模型(LLMs)中在策略蒸餾(OPD)的動態與機制。解決了人們對OPD有時失敗的原因缺乏理解的問題,並提供實用策略,在蒸餾未成功時恢復性能。
工作原理
本專案分析蒸餾過程中學生模型與教師模型之間的互動。識別出兩個關鍵成功條件:學生模型與教師模型必須具備相容的思考模式,且教師模型必須提供學生模型在訓練期間尚未遇到的能力。
為改善OPD,專案實作了以下方法:
- 離策略冷啟動:一種用於初始化學生模型的策略。
- 教師對齊的提示選擇:一種選擇更符合教師優勢提示的方法。
- token級獎勵信號:使用教師模型根據token機率提供密集獎勵(採用多種Top-K選擇與加權策略)。
適用對象
從事LLM後訓練的研究人員與開發者,特別是那些使用蒸餾技術將大型、更強大教師模型的知識遷移到小型學生模型的人。
主要亮點
- 機制分析:證明成功的OPD依賴於學生模型訪問狀態中高機率token的逐步對齊。
- 實用恢復:提供具體配方(冷啟動與提示選擇)以修復失敗的蒸餾執行。
- 整合診斷:已將診斷功能合併至
verl框架中,用於追蹤重疊率與token優勢。 - 靈活訓練:支援多種Top-K策略(聯集、交集等)與token獎勵的加權方案。
相關
- 專案
- 專案
- 專案
- 專案