huggingface/alignment-handbook

Robust recipes to align language models with human and AI preferences

해결하는 문제

The Alignment Handbook은 언어 모델을 인간 및 AI 선호도에 맞게 조정할 수 있도록 표준화되고 강력한 학습 레시피를 제공합니다. 이 프로젝트는 챗봇 모델 학습을 위한 공개 리소스의 부족함을 해결하며, 특히 데이터 수집 방법과 단순한 지도 미세 조정(SFT)을 넘어선 고급 정렬 기술 사용법에 중점을 둡니다.

작동 방식

이 프로젝트는 크게 두 가지 구성 요소로 나뉩니다.

  • Scripts: 분산 학습(DeepSpeed ZeRO-3 사용) 또는 효율적인 파라미터 미세 조정(LoRA/QLoRA)을 지원하는 학습 및 평가 스크립트입니다. 이 스크립트들은 지속적인 사전 학습, SFT, 그리고 DPO 및 ORPO와 같은 방법을 사용한 선호도 정렬까지 전체 파이프라인을 다룹니다.
  • Recipes: 특정 학습 실행에 필요한 정확한 파라미터가 포함된 YAML 설정 파일로, 사용자가 Zephyr 7B나 SmolLM과 같은 모델을 재현할 수 있도록 합니다.

대상 사용자

오픈 소스 LLM을 학습, 적응 또는 정렬하여 지시 사항을 따르고 특정 선호도를 준수하도록 만들고자 하는 머신러닝 실무자 및 연구자를 위해 설계되었습니다.

주요 특징

  • 포괄적인 파이프라인: 지속적인 사전 학습, SFT, 보상 모델링, 거부 샘플링 및 선호도 최적화를 지원합니다.
  • 고급 정렬 기술: 직접 선호도 최적화(DPO), 오즈비 선호도 최적화(ORPO) 및 헌법 AI(Constitutional AI)를 구현합니다.
  • 재현성: 최첨단 소형 LLM 및 코딩 어시스턴트를 재현하기 위한 구체적인 레시피를 제공합니다.
  • 유연한 학습: DeepSpeed를 사용한 전체 가중치 학습 또는 LoRA/QLoRA를 통한 효율적인 미세 조정을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트