Thinking-Space/Rethinking-OPD

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

解決的問題

本專案研究大語言模型(LLMs)中在策略蒸餾(OPD)的動態與機制。解決了人們對OPD有時失敗的原因缺乏理解的問題,並提供實用策略,在蒸餾未成功時恢復性能。

工作原理

本專案分析蒸餾過程中學生模型與教師模型之間的互動。識別出兩個關鍵成功條件:學生模型與教師模型必須具備相容的思考模式,且教師模型必須提供學生模型在訓練期間尚未遇到的能力。

為改善OPD,專案實作了以下方法:

  • 離策略冷啟動:一種用於初始化學生模型的策略。
  • 教師對齊的提示選擇:一種選擇更符合教師優勢提示的方法。
  • token級獎勵信號:使用教師模型根據token機率提供密集獎勵(採用多種Top-K選擇與加權策略)。

適用對象

從事LLM後訓練的研究人員與開發者,特別是那些使用蒸餾技術將大型、更強大教師模型的知識遷移到小型學生模型的人。

主要亮點

  • 機制分析:證明成功的OPD依賴於學生模型訪問狀態中高機率token的逐步對齊。
  • 實用恢復:提供具體配方(冷啟動與提示選擇)以修復失敗的蒸餾執行。
  • 整合診斷:已將診斷功能合併至 verl 框架中,用於追蹤重疊率與token優勢。
  • 靈活訓練:支援多種Top-K策略(聯集、交集等)與token獎勵的加權方案。

相關

  • 專案
  • 專案
  • 專案
  • 專案