thunlp/OPD

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

해결하는 문제

이 프로젝트는 대규모 언어 모델에서 온폴리시 디스틸레이션(OPD)의 학습 다이내믹스와 실패 모드에 대한 이해 부족을 해결합니다. OPD가 성공하거나 실패하는 이유를 체계적으로 조사하고, 디스틸레이션이 실패했을 때 성능을 회복할 수 있는 실용적인 전략을 제시합니다.

작동 방식

OPD는 교사 모델이 제공하는 토큰 수준의 보상 신호를 사용하여 학생 모델을 훈련하는 과정입니다. 본 프로젝트는 성공을 위한 두 가지 핵심 조건을 식별합니다: 학생과 교사 모델은 호환되는 사고 패턴을 가져야 하며, 교사 모델은 학생 모델이 이미 경험하지 않은 능력을 제공해야 합니다.

실패한 OPD를 개선하기 위해 두 가지 구체적인 전략을 구현합니다:

  1. 오프폴리시 콜드스타트: 모델 간 격차를 메우기 위한 초기화 과정.
  2. 교사에 맞춘 프롬프트 선택: 학생 모델을 교사의 능력과 더 잘 일치시키는 프롬프트 선택.

기술적으로는 verl 프레임워크를 강화학습 및 디스틸레이션에, LlamaFactory를 지도형 미세조정(SFT)에 사용하며, 보상 신호를 최적화하기 위한 다양한 Top-K 토큰 선택 및 가중 전략을 지원합니다.

대상 사용자

모델 디스틸레이션, LLM의 포스트트레이닝, 대규모 교사 모델에서 소규모 학생 모델로 지식을 전이하는 것을 최적화하고자 하는 연구자 및 개발자.

주요 특징

  • 기계적 분석: 성공적인 OPD가 학생 모델이 방문한 상태에서 고확률 토큰의 일치에 의존함을 토큰 수준에서 분석.
  • 회복 전략: 실패한 디스틸레이션을 수정하기 위한 오프폴리시 콜드스타트와 교사에 맞춘 프롬프트 선택 도입.
  • 통합: 진단 메트릭(overlap_ratiooverlap_token_advantage)을 verl 라이브러리에 통합.
  • 유연한 구성: 여러 Top-K 전략(합집합, 교집합 등)과 보상 가중 전략을 지원.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트