Thinking-Space/Rethinking-OPD

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

해결하는 문제

이 프로젝트는 대규모 언어 모델(LLM)을 위한 온폴리시 디스틸레이션(OPD)의 역학과 메커니즘을 조사합니다. OPD가 때때로 실패하는 이유에 대한 이해 부족을 해결하고, 증류가 성공하지 못했을 때 성능을 회복할 수 있는 실용적인 전략을 제공합니다.

작동 방식

이 프로젝트는 증류 과정에서 학습 모델과 교사 모델 간의 상호작용을 분석합니다. 성공을 위한 두 가지 핵심 조건을 식별했습니다: 학습 모델과 교사 모델은 호환되는 사고 패턴을 가져야 하며, 교사 모델은 학습 모델이 훈련 중에 이미 경험하지 않은 능력을 제공해야 합니다.

OPD를 개선하기 위해 다음과 같은 기법을 구현했습니다:

  • 오프폴리시 콜드스타트: 학습 모델을 초기화하는 전략.
  • 교사에 맞춘 프롬프트 선택: 교사의 강점과 더 잘 일치하는 프롬프트를 선택하는 방법.
  • 토큰 수준의 보상 신호: 교사 모델을 사용하여 토큰 확률 기반의 밀도 높은 보상을 제공(다양한 Top-K 선택 및 가중 전략 사용).

대상 사용자

대규모 언어 모델의 후처리 작업에 종사하는 연구자 및 개발자. 특히 더 큰 능력을 가진 교사 모델에서 더 작은 학습 모델로 지식을 전달하기 위해 증류를 사용하는 사람.

주요 특징

  • 메커니즘 분석: 성공적인 OPD가 학습 모델이 방문한 상태에서 고확률 토큰에 대한 점진적인 정렬에 의존함을 입증.
  • 실용적 회복: 실패한 증류 실행을 수정하기 위한 구체적인 조리법(콜드스타트 및 프롬프트 선택) 제공.
  • 통합: verl 프레임워크에 통합된 진단 기능을 통해 겹침 비율과 토큰 우위를 추적 가능.
  • 유연한 훈련: 여러 Top-K 전략(합집합, 교집합 등)과 토큰 보상에 대한 가중 전략을 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트