allenai/open-instruct
AllenAI's post-training codebase
해결하는 문제
Open Instruct는 공개된 데이터셋을 사용하여 인기 있는 사전 학습된 언어 모델의 지시 조정 및 후처리를 통합된 프레임워크로 제공합니다. Tülu 시리즈와 같은 고품질의 지시에 따라 행동하는 모델을 만드는 과정을 코드, 레시피, 아티팩트를 제공함으로써 개방적이고 재현 가능한 방식으로 만들고자 합니다.
작동 방식
이 프로젝트는 다단계 후처리 파이프라인을 구현합니다:
- 지도된 미세조정 (SFT): 통합된 형식의 지시 데이터셋을 사용하여 베이스 모델을 미세조정합니다.
- 선호도 조정: 직접 선호도 최적화(DPO)와 PPO를 구현하여 모델을 인간의 선호에 맞춥니다.
- 검증 가능한 보상과 함께하는 강화학습(RLVR): GRPO와 같은 기술을 사용하여 검증 가능한 보상을 활용해 모델을 훈련합니다.
- 파라미터 효율적인 조정: LoRA와 QLoRA를 지원하여 더 접근성 높은 미세조정을 가능하게 합니다.
대상 사용자
Tülu 모델을 재현하거나 오픈소스 언어 모델에 고급 후처리 기술(SFT, DPO, RLVR)을 적용하고자 하는 연구자 및 개발자.
주요 특징
- 포괄적인 파이프라인: SFT에서 선호도 조정, RLVR에 이르기까지 전반적인 흐름을 커버합니다.
- Tülu 모델 세트: Tülu 1, 2, 3 시리즈 모델의 훈련 레시피와 체크포인트를 제공합니다.
- 데이터 정제 도구: 훈련 및 평가 데이터셋 간의 중복을 측정하는 스크립트를 포함하여 공정한 평가를 보장합니다.
- 광범위한 모델 호환성: Llama 3.1 및 OLMo 2 모델과 호환됩니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트