chrisliu298/awesome-on-policy-distillation

A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models

해결하는 문제

이 프로젝트는 온폴리시 디스틸레이션 (OPD) 를 위한 큐레이션된 리소스 모음 제공합니다. 이는 더 큰 "선생님" 모델을 사용하여 더 작은 "학생" 대규모 언어 모델(LLM)을 훈련시키는 기술입니다. 전통적인 디스틸레이션과 달리, OPD는 학생 모델이 스스로 생성한 샘플 위에서 훈련되므로 "학습-추론 분포 갭"을 해결합니다. 이로써 학생 모델은 자신의 실수를 수정하는 방법을 배울 수 있습니다.

작동 방식

OPD 루프에서는 학생 모델이 트래잭토리(롤아웃)를 생성합니다. 이후 선생님 모델이 해당 학생이 생성한 특정 샘플에 대해 밀도 높은 토큰 단위의 감독 또는 점수를 제공합니다. 이 과정은 다음과 같은 방식으로 구현할 수 있습니다:

  • 화이트박스: 학생 모델이 선생님의 내부 확률 분포(로짓)에 접근할 수 있습니다.
  • 블랙박스: 선생님 모델은 API를 통해 접근되며, 학생 모델은 보상이나 디스커미네이터로부터 학습합니다.
  • 자기 디스틸레이션: 모델이 선생님과 학생 모두의 역할을 하며, 종종 특권적 컨텍스트를 사용하여 스스로 개선합니다.

대상 사용자

  • AI 연구자: 모델 압축, 지식 디스틸레이션, 포스트트레이닝 정렬에 관심 있는 연구자.
  • ML 엔지니어: Qwen, DeepSeek, NVIDIA 등에서 사용하는 산업용 디스틸레이션 레시피를 구현하여 효율적이고 고성능의 소형 모델을 만들고자 하는 개발자.
  • LLM 실무자: 모델이 훈련되는 방식과 실제 추론 시 성능 간 격차를 줄이고자 하는 누구나.

주요 특징

  • 포괄적인 분류 체계: OPD 루프에서의 역할(기초, 갭 해소, 안정성 등)에 따라 수백 개의 논문과 보고서를 정리했습니다.
  • 산업용 레시피: Alibaba (Qwen3), DeepSeek (V4), NVIDIA (Nemotron-Cascade 2) 등의 주요 연구소에서 제공하는 기술 보고서 포함.
  • 구현 가이드: TRL의 DistillationTrainer 와 같은 프레임워크 및 도구에 대한 링크로 훈련을 가속화합니다.
  • 다양한 모달리티: OPD의 확장이 에이전트, 멀티모달 모델, 음성, 로보틱스에 이르는 분야를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트