通过辩论实现 AI 安全
OpenAI 提出了一种新的 AI 安全技术,训练代理相互辩论主题,并使用人类裁判来决定胜者。此方法旨在让人类能够监督执行认知高级任务的 AI 系统,这些任务过于复杂,无法直接由人类评估。
AI 对齐的辩论框架
AI 对齐通常依赖人类在训练期间识别安全且有用的行为。然而,当代理的行为对人类而言过于复杂或任务难以评判时,这种方法会失效。为了解决此问题,OpenAI 提议将学习问题重新构建为两位代理之间的辩论游戏,由人类担任裁判。
核心前提是,即使 AI 代理对问题的理解比人类裁判更高级,人类仍然能够判断哪位代理提出了更好的论点。代理通过自我对弈进行训练,类似 AlphaGo Zero 的方法。目标是让辩论逐步聚焦于越来越简单的事实争议,直至出现一个足够简单、能够被人类正确判断的主张。
概念验证:稀疏 MNIST 分类器
为了在受控环境中测试该概念,OpenAI 使用 MNIST 数据集进行实验。在此设置中,“裁判”是一个分类器,仅通过六个随机的非黑像素来预测数字。两位辩手对图像拥有完整的了解,而裁判对大部分图像是“盲目的”。
关键结果包括:
- 准确率提升:当辩手必须提前声明立场时,稀疏分类器的准确率从 59.4% 提升至 88.9%。
- 诚实 vs. 恶意对弈:一个代理诚实地帮助裁判正确猜测,另一个则试图欺骗裁判。诚实的玩家赢得了 88.9% 的胜率。
- 错误模式:辩论中成功的谎言集中在数字 8 和 9,表明某些数字比其他数字更容易被误导。
以人为中心的猫狗辩论测试
OpenAI 开发了一个原型网站,以测试在人类参与者担任辩手和裁判时的辩论机制。在这些“猫 vs. 狗”辩论中,辩手可以使用自然语言阐述立场,但只能揭示图像中一个保证真实的像素来解决争议。
OpenAI 的非正式测试表明,诚实的代理通常获胜,因为随着辩论的进行,谎言更难维持,且代理会聚焦于具体的争议事实。研究人员指出,限制裁判获取信息的频率可以使游戏对说谎者更公平,因为构造详细的谎言在认知上要求很高。
局限性与未来方向
虽然辩论模型提供了一种为复杂目标生成训练信号的方法,但它存在若干根本性局限:
- 鲁棒性:辩论并未解决对抗样本或分布漂移问题;它是一种训练信号的方法,而非鲁棒性的保证。
- 理论保证:没有理论保证自我对弈总能达到最优策略或正确陈述。
- 计算成本:进行辩论训练的代理比直接给出答案的代理需要更多计算资源。
- 人类裁判的局限:人类裁判可能偏见过大或缺乏认知能力,即使辩论已缩小至简单事实,也难以作出正确判断。
未来的工作将聚焦于更具挑战性的视觉实验、自然语言辩论,以及测试系统在价值取向问题上的表现,因为此类问题可能受到人类偏见的影响。
Sources
- OriginalAI safety via debate