OpenAI 弱到强泛化研究
OpenAI 引入了一条新的超对齐研究方向,展示了可以使用 GPT-2 级别的模型来监督更大的模型(GPT-4),以激发接近 GPT-3.5 性能水平的能力。这项研究至关重要,因为它表明我们可以利用深度学习的泛化特性,通过弱监督者来控制强模型,这是对齐未来超人类 AI 系统的必要一步。
超对齐问题
未来的 AI 系统可能很快达到超智能——远超人类的 AI。超对齐的核心挑战在于,人类作为“弱监督者”,需要可靠地引导和控制远比他们更强大的 AI 系统。
传统的对齐方法,如来自人类反馈的强化学习(RLHF),依赖于人类监督。然而,这些方法在超人类模型上可能难以扩展,因为人类无法可靠地监督极其复杂的行为,例如创建数百万行新颖且可能危险的计算机代码,这超出了人类专家的理解范围。
实验设置:小模型到大模型监督
为了对超对齐问题进行实证研究,OpenAI 研究人员使用了一个代理类比:用较小、能力较弱的模型来监督更大、更强大的模型。
核心问题是强大的预训练模型是否能够根据弱监督者的潜在意图进行泛化,而不是仅仅模仿弱监督者的错误。由于强模型拥有潜在知识,目标是利用较小模型的监督信号来激发这些知识。
关键结果与发现
OpenAI 发现他们可以在多种情境下显著提升泛化能力。通过使用一种鼓励强模型更有信心的方法——包括在必要时自信地与弱监督者持不同意见——他们仅使用 GPT-2 级别的监督在 NLP 任务上就恢复了 GPT-4 大部分能力。最终模型的性能通常介于 GPT-3 与 GPT-3.5 之间。
- Generalization to hard problems: 强模型即使在弱监督者失败的困难问题上也能正确泛化。
- Alternative approaches: 研究人员在其他方法中观察到“生机”,例如从小模型到中等模型再到大模型的自举以及最佳的提前停止。
- Limitations: 该方法仍是概念验证,目前在 ChatGPT 偏好数据上尚不可用。
对 AI 对齐的影响
结果表明,虽然朴素的人类监督(如 RLHF)在超人类模型上可能难以扩展,但显著提升弱到强的泛化是可行的。
然而,研究人员指出一个潜在的类比不匹配:未来的超人类模型可能更容易模仿人类错误,而当前的强模型模仿当前弱模型的错误则相对困难。这可能使得未来的对齐比当前的代理实验所暗示的更为困难。
社区资源与资助
为了加速该领域的研究,OpenAI 已发布开源代码以促进弱到强的泛化实验,并启动了 1000 万美元的资助计划,面向专注于超人类 AI 对齐的研究生、学者及其他研究人员。
Sources
- OriginalWeak-to-strong generalization