huggingface/alignment-handbook

Robust recipes to align language models with human and AI preferences

解决的问题

The Alignment Handbook 提供了一套标准化且强大的训练配方,协助社区将语言模型与人类及 AI 的偏好对齐。它填补了公开资源在训练对话模型方面的空白,特别着重于如何收集数据以及使用超越简单监督式微调 (SFT) 的进阶对齐技术。

运作方式

本项目分为两个主要部分:

  • Scripts: 支持分布式训练 (通过 DeepSpeed ZeRO-3) 或参数高效微调 (LoRA/QLoRA) 的训练与评估脚本。这些脚本涵盖了完整流程:持续预训练、SFT,以及使用 DPO 和 ORPO 等方法的偏好对齐。
  • Recipes: 包含特定训练运行确切参数的 YAML 配置文件,让用户能够重现如 Zephyr 7B 或 SmolLM 等模型。

适用对象

专为机器学习从业者与研究人员设计,适合想要训练、调整或对齐开源 LLM 以遵循指令并符合特定偏好的用户。

特色亮点

  • 完整流程: 支持持续预训练、SFT、奖励建模、拒绝采样与偏好优化。
  • 进阶对齐技术: 实现了直接偏好优化 (DPO)、胜算比偏好优化 (ORPO) 与宪法 AI (Constitutional AI)。
  • 可重现性: 提供特定配方以复制最先进的小型 LLM 与代码助手。
  • 灵活训练: 支持使用 DeepSpeed 进行全权重训练,或通过 LoRA/QLoRA 进行高效微调。

相关

  • 项目
  • 项目
  • 项目
  • 项目