huggingface/alignment-handbook

Robust recipes to align language models with human and AI preferences

解決的問題

The Alignment Handbook 提供了一套標準化且強大的訓練配方,協助社群將語言模型與人類及 AI 的偏好對齊。它填補了公開資源在訓練對話模型方面的空白,特別著重於如何收集數據以及使用超越簡單監督式微調 (SFT) 的進階對齊技術。

運作方式

本專案分為兩個主要部分:

  • Scripts: 支援分散式訓練 (透過 DeepSpeed ZeRO-3) 或參數高效微調 (LoRA/QLoRA) 的訓練與評估腳本。這些腳本涵蓋了完整流程:持續預訓練、SFT,以及使用 DPO 和 ORPO 等方法的偏好對齊。
  • Recipes: 包含特定訓練運行確切參數的 YAML 設定檔,讓使用者能夠重現如 Zephyr 7B 或 SmolLM 等模型。

適用對象

專為機器學習從業者與研究人員設計,適合想要訓練、調整或對齊開源 LLM 以遵循指令並符合特定偏好的使用者。

特色亮點

  • 完整流程: 支援持續預訓練、SFT、獎勵建模、拒絕採樣與偏好最佳化。
  • 進階對齊技術: 實作了直接偏好最佳化 (DPO)、勝算比偏好最佳化 (ORPO) 與憲法 AI (Constitutional AI)。
  • 可重現性: 提供特定配方以複製最先進的小型 LLM 與程式碼助手。
  • 靈活訓練: 支援使用 DeepSpeed 進行全權重訓練,或透過 LoRA/QLoRA 進行高效微調。

相關

  • 專案
  • 專案
  • 專案
  • 專案