chrisliu298/awesome-on-policy-distillation

A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models

解決的問題

本專案提供針對 線上策略蒸餾(OPD) 的精選資源集合,這是一種利用較大規模的「教師」模型來訓練較小的「學生」大型語言模型(LLM)的技術。與傳統蒸餾不同,OPD 透過讓學生在自身生成的樣本上進行訓練,而非固定資料軌跡,從而解決「訓練-推論分佈差距」問題,確保學生模型能學會修正自身的錯誤。

如何運作

在 OPD 迴圈中,學生模型產生軌跡(rollouts)。隨後,教師模型對這些特定的學生生成樣本提供密集的、逐 token 的監督或評分。此過程可透過以下幾種方式實現:

  • 白盒: 學生模型可存取教師模型的內部機率分佈(logits)。
  • 黑盒: 教師模型透過 API 存取,學生模型從獎勵或判別器中學習。
  • 自蒸餾: 模型同時扮演教師與學生角色,通常利用特權上下文來提升自身效能。

適用對象

  • AI 研究者: 關注模型壓縮、知識蒸餾與後訓練對齊的研究人員。
  • ML 工程師: 希望實作工業級蒸餾方案(如 Qwen、DeepSeek 或 NVIDIA 所用方案)以建構高效、高性能量小模型的開發者。
  • LLM 實務者: 任何希望縮小模型訓練方式與實際推論表現之間差距的人。

亮點

  • 全面的分類體系: 按照 OPD 迴圈中的角色(基礎、填補差距、穩定性等)對數百篇論文與報告進行組織。
  • 工業級方案: 包含來自阿里巴巴(Qwen3)、DeepSeek(V4)與 NVIDIA(Nemotron-Cascade 2)等主要實驗室的技術報告。
  • 實作指南: 提供 TRL 的 DistillationTrainer 等框架與工具的連結,加速訓練過程。
  • 多模態擴展: 涵蓋 OPD 在智能體、多模態模型、語音與機器人領域的延伸應用。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案