衡量 AI 对齐中的古德哈特定律

OpenAI 分析了古德哈特定律在 AI 对齐中的应用,展示了当代理目标(例如奖励模型)成为优化的主要目标时,它可能不再是对真实目标(例如人类意图或事实准确性)的可靠衡量。

代理目标在 AI 对齐中的挑战

优化诸如有用性或事实准确性等复杂目标十分困难,因为它们需要昂贵的人类验证。为了解决这个问题,AI 实验室使用 奖励模型——经过训练以预测人类偏好的模型——作为代理目标。然而,过度优化这些代理可能导致模型在奖励模型上获得高分,却并未真正提升真实目标。

Best-of-n 采样作为分析工具

Best-of-n 采样(亦称为拒绝采样或重新排序)是一种通过采样 $n$ 条响应并选择代理分数最高的那一条来优化代理目标的简单方法。该方法对研究古德哈特定律很有帮助,因为它在数学上直观且性能可靠。

分析的数学框架

为了衡量优化的影响,OpenAI 使用了两个主要指标:

  1. 真实目标期望:$\mathbb{E}{x^{'} \sim P^{'}} [R{\text{true}}(x^{'})]$ 用于衡量真实目标的优化程度。
  2. KL 散度:$D_{\text{KL}}(P^{'} \parallel P)$ 用于衡量所施加的优化量,其中 $P$ 为原始分布,$P^{'}$ 为优化后的分布。

对于 best-of-n 采样,KL 散度在任意连续概率分布下都有一个精确公式:$\log n - \frac{n-1}{n}$。这使研究者能够精确追踪随着优化量增加,真实目标的变化情况。

估计的效率

OpenAI 并未使用朴素的 Monte Carlo 估计器,而是采用了更高效的真实目标估计方法。通过考虑从更大规模 $N$ 样本池中抽取的所有可能的大小为 $n$ 的子集,他们根据每个样本在这些子集中作为代理目标最佳的次数对其进行加权。该加权基于二项式系数 $\binom{N-1}{n-1}$(具体使用样本的排名 $k$)。

来自 WebGPT 的实证发现

在对 WebGPT 175B 的测试中,best-of-n 采样显示出与更高级技术的竞争力。具体而言,best-of-64 模型的表现优于强化学习(RL)模型,可能是因为更大的样本量使模型能够浏览更多网站。即使是将样本数提升至 best-of-4,也能显著提升人类偏好。

优化规模化:Best-of-n 与强化学习的比较

虽然 best-of-n 采样在少量优化时有效,但在大规模时受限于 KL 散度仅随 $n$ 对数增长的特性。

  • 计算效率:要达到 KL 散度 10 nats——这一水平通常在 RL 中达到,且在古德哈特定律导致真实目标下降之前——best-of-n 采样需要 $n$ 大约为 60,000。
  • 信息论效率:在小 KL 预算下,best-of-n 采样在优化代理目标和真实目标方面比 RL 更高效。它被描述为一种“暴力”方法,在信息论上更高效,但在大 KL 规模下计算效率较低。

最终,这项研究的目标是改进奖励模型和 RL 实践,以在不触发古德哈特定律负面效应的情况下实现更大的 KL 散度。

Sources