huggingface/alignment-handbook
Robust recipes to align language models with human and AI preferences
解决的问题
The Alignment Handbook 提供了一套标准化且强大的训练配方,协助社区将语言模型与人类及 AI 的偏好对齐。它填补了公开资源在训练对话模型方面的空白,特别着重于如何收集数据以及使用超越简单监督式微调 (SFT) 的进阶对齐技术。
运作方式
本项目分为两个主要部分:
- Scripts: 支持分布式训练 (通过 DeepSpeed ZeRO-3) 或参数高效微调 (LoRA/QLoRA) 的训练与评估脚本。这些脚本涵盖了完整流程:持续预训练、SFT,以及使用 DPO 和 ORPO 等方法的偏好对齐。
- Recipes: 包含特定训练运行确切参数的 YAML 配置文件,让用户能够重现如 Zephyr 7B 或 SmolLM 等模型。
适用对象
专为机器学习从业者与研究人员设计,适合想要训练、调整或对齐开源 LLM 以遵循指令并符合特定偏好的用户。
特色亮点
- 完整流程: 支持持续预训练、SFT、奖励建模、拒绝采样与偏好优化。
- 进阶对齐技术: 实现了直接偏好优化 (DPO)、胜算比偏好优化 (ORPO) 与宪法 AI (Constitutional AI)。
- 可重现性: 提供特定配方以复制最先进的小型 LLM 与代码助手。
- 灵活训练: 支持使用 DeepSpeed 进行全权重训练,或通过 LoRA/QLoRA 进行高效微调。
相关
- 项目
- 项目
- 项目
- 项目