chrisliu298/awesome-on-policy-distillation

A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models

What it solves

이 저장소는 고정 데이터셋(오프‑policy)으로 학습된 대규모 언어 모델(LLM)이 추론 시 독립적으로 텍스트를 생성해야 할 때 발생하는 "학습‑추론 분포 격차"(노출 편향)를 해결합니다. 온‑policy 디스틸레이션(OPD)에 초점을 맞추어, 개발자와 연구자가 학생 모델이 자체적으로 진화하는 출력에 대해 학습하면서 교사 모델로부터 토큰 수준의 밀집된 지도를 받을 수 있도록 엄선된 리소스를 제공합니다.

How it works

온‑policy 디스틸레이션은 루프 형태로 진행됩니다. 학생 모델이 현재 정책으로 트래젝터리(샘플)를 생성하고, 교사 모델—외부 특권 모델이거나 동일 모델(셀프‑디스틸레이션)일 수도 있음—이 해당 학생 생성 샘플에 대해 점수를 매기거나 감독 신호를 제공합니다. 이 과정을 통해 학생은 자신의 실수를 교정하고, 학습 분포를 실제 추론 행동과 일치시킵니다.

Who it’s for

  • AI Researchers 훈련 후 프리미티브, 정책 그라디언트, 지식 디스틸레이션을 연구하는 사람들.
  • ML Engineers 프로덕션 LLM을 위한 모델 압축 또는 기능 전이를 구현하는 엔지니어.
  • Developers Alibaba(Qwen), DeepSeek, NVIDIA 등 랩에서 사용되는 산업 레시피를 찾는 개발자.

Highlights

  • Comprehensive Taxonomy: 피드백 신호, 교사 접근 방식(화이트박스 vs. 블랙박스), 손실 범위에 따라 수백 개의 논문과 도구를 정리.
  • Industrial Recipes: 주요 랩의 기술 보고서(Qwen3, DeepSeek‑V4, GLM‑5 등)를 포함해 OPD가 실제 프로덕션에 어떻게 사용되는지 보여줍니다.
  • Diverse Variants: 외부 교사 없이 자체 디스틸레이션을 수행하는 셀프‑디스틸레이션, API 전용 교사만 사용하는 블랙박스 OPD, 프롬프트를 가중치로 디스틸레이션하는 컨텍스트 내재화 등 다양한 기법을 포괄합니다.
  • Implementation Guides: 프레임워크와 엔지니어링 워크스루에 대한 링크를 제공하며, 고속 디스틸레이션을 위한 TRL의 DistillationTrainer도 포함합니다.