使用直接偏好优化方法对大型语言模型进行偏好调优 – DPO、IPO 与 KTO 的实证比较
TL;DR – Hugging Face 评估了三种无强化学习的对齐方法——直接偏好优化(Direct Preference Optimization, DPO)、身份偏好优化(Identity Preference Optimisation, IPO)和卡尼曼‑特沃斯基优化(Kahneman‑Tversky Optimisation, KTO)——在两个 7B 对话模型上进行实验,发现只要对超参数(尤其是 β 权重)进行仔细调优,DPO 始终优于其他方法。
引言
本文报告了对三种最新的大型语言模型对齐算法的实证比较,这些算法避免了传统的强化学习。研究对两个高质量的 7B 模型(OpenHermes‑2.5‑Mistral‑7B 和 Zephyr‑7b‑beta‑sft)进行微调,使用三种损失函数(DPO、IPO、KTO)在 β 超参数的不同取值上进行扫描,并使用 MT‑Bench(基于 GPT‑4 的多轮基准)对生成的模型进行评估,覆盖八大能力类别。
无强化学习的对齐方法
- Direct Preference Optimization (DPO) – 将对齐重新表述为对配对偏好元组 ((x, y_w, y_l)) 的简单损失,并已用于训练诸如 Zephyr 和 Intel 的 NeuralChat 等模型。
- Identity Preference Optimisation (IPO) – 在 DPO 基础上加入正则化项,以提升鲁棒性并允许训练在不提前停止的情况下收敛。
- Kahneman‑Tversky Optimisation (KTO) – 仅使用二元的“好/坏”标签,而非配对偏好,从而可以利用更廉价的反馈信号(如点赞/点踩)进行对齐。
这三种方法均通过 🤗 TRL 库的 DPOTrainer 实现,loss_type 参数分别设为 sigmoid(DPO)、ipo(IPO)或 kto_pair(KTO)。
实验设置
- Models: OpenHermes‑2.5‑Mistral‑7B(未对齐的 7B 对话模型)和 Zephyr‑7b‑beta‑sft(已在监督数据上微调)。
- Datasets:
- orca_dpo_pairs(13 k 条提示对,GPT‑4 选中 vs. Llama‑Chat‑13B 被拒绝)– 用于 OpenHermes。
- ultrafeedback‑binarized(66 k 条提示对)– 用于 Zephyr。
- Training configuration: 单轮训练,每个设备 batch size 为 8,学习率 5e‑7,余弦调度器,β 取值范围 0.01 到 0.9,使用梯度检查点,启用 bf16,并每 100 步进行一次评估。
- Evaluation: MT‑Bench,使用 GPT‑4 对模型回复进行评分,涵盖 Writing、Roleplay、Reasoning、Math、Coding、Extraction、STEM 和 Humanities 八大类别。
完整的配置文件和脚本可在 Hugging Face 的 alignment‑handbook 仓库中获取。
超参数扫描
通过对每种损失类型的 beta 参数(0.01、0.1 … 0.9)进行系统性扫描,同时保持其他设置不变,完成了超参数扫描。该扫描在 Hugging Face GPU 集群上使用 Bash 脚本启动,脚本遍历模型配置、损失类型和 β 值,并将每次运行提交为单独的 SLURM 作业。
configs=("zephyr" "openhermes")
loss_types=("sigmoid" "kto_pair" "ipo")
betas=("0.01" "0.1" "0.2" "0.3" "0.4" "0.5" "0.6" "0.7" "0.8" "0.9")
# ... loop omitted for brevity ...
结果
Zephyr‑7b‑beta‑SFT
- 最低的 β(0.01)在 所有三种算法 中获得了最高的 MT‑Bench 分数。
- DPO 获得了整体最高的 MT‑Bench 分数,但 KTO(配对) 在除一种情况外的所有设置中都匹配或超越了 DPO。
- IPO 在大多数配置下的表现不如基础 Zephyr 模型,尽管其理论上更具鲁棒性。
- 按类别分析显示在 Reasoning、Coding 和 Math 上存在显著差距。
OpenHermes‑2.5‑Mistral‑7B
- 算法排名仍为 DPO > KTO > IPO。
- 最佳 β 值差异显著:
- DPO: β = 0.6
- KTO: β = 0.3
- IPO: β = 0.01
- 偏好对齐仅将 MT‑Bench 提升约 0.3 分,表明 OpenHermes 已经是一个强大的基础模型。
这两类模型均表明 β 是关键的超参数;微小的变化即可导致性能在 MT‑Bench 上相差数分。
总结与洞察
- 对所有三种对齐方法而言,细致的 β 调优至关重要。
- 在配对偏好设置下,DPO 始终优于 KTO 与 IPO,但在 β 选取得当时 KTO 也具竞争力。
- 虽然 IPO 提供收敛保证,但在本实验中未能超越基线。
- 开源代码、配置以及生成的模型检查点已在 Hugging Face 的 alignment‑handbook 与相应的模型集合中公开。
接下来?
未来的工作将继续向 🤗 TRL 添加新的偏好对齐算法并扩展评估套件。作者预计 DPO 将在短期内仍是最稳健的选择,而 KTO 则提供了一条利用廉价二元反馈而无需配对数据的有前景路径。
链接