对齐,而非配置:将 AI 对齐重新思考为一个相互的过程
当前的 AI 对齐讨论通常被框架化为一个二元选择:我们是优先考虑安全性(“末日论者”)还是加速(“e/acc”群体)?在这场激烈的辩论中,焦点仍然在于如何最好地配置 AI——如何安装正确的价值观,如何衡量对这些价值观的遵循程度,以及如何确保系统不会偏离预定义的路径。
然而,这种框架忽略了一个根本事实:那些生活受这些系统影响最深的人,很少是设计对齐协议的人。当我们把对齐视为一个技术配置问题时,我们面临着将人类经验转化为统计代理的风险,实际上是在为人们设计,而从未与人们共同设计。
配置哲学
大多数 AI 实验室都在一种可以被称为“配置哲学”的模式下运作。在这种模式下,对齐被视为一条单行道:价值观从人类设计师流向 AI 系统。目标是将可以被衡量和验证的倾向安装到系统中。
这种方法导致了一个闭环评估系统。正如 Anthropic 等实验室最近的方法论所示,该过程通常涉及一个模型生成数据,另一个模型对其进行提示,而第三个模型判断输出。虽然这在技术上是高效且可扩展的,但它创造了一个完全脱离实际人类经验的机制。对齐过程中的“我们”变成了一个统计代理——一组受雇的评分员,其反馈被提炼成奖励函数。
智能的相互塑造
真正的对齐不是人类对 AI 做 的事情;它是发生在两个参与方之间的事情。作者建议,人类与 AI 之间的互动更像是塑造湿粘土,而不是向工具发出指令。
在这种相互的过程中,塑造是互惠的:
- 系统会反作用: AI 的响应往往会偏离目标,或者显现出意想不到的模式,迫使人类去修正其原始意图。
- 人类会调整: 随着我们与这些系统互动,我们自己的习惯、思维和工作流也会发生变化。
正如一位社区成员所指出的,这种转变往往是无形的:
"回顾过去,我的提示词并没有改变那么多,改变的是我工作的方式。"
当我们认为自己只是在“变得更擅长提示”时,我们实际上正在经历一种相互适应。配置哲学使这种人类进化变得无形,将人类视为固定点,而将 AI 视为唯一的变量。这是一个危险的遗漏,因为它忽略了 AI 如何在积极地塑造人类的认知和能动性。
当前范式的风险
当对齐被简化为配置时,产生的系统可能会变得疏离。一些用户报告说感觉自己的思维变得“机器化”了,即人类仅仅充当了 AI 相互交谈的管道。
此外,安全与加速之间的辩论往往掩盖了一个更深层的共识:即一小部分精英设计师应该决定其余人类的命运。无论是呼吁采取极端措施来防止失控的 AI,还是将失业工人视为“愤恨者”,双方往往都将普通大众视为进行工作的材料,而不是过程中的合作伙伴。
迈向参与式对齐
如果我们想要超越“配置”模型,我们必须认识到,许多人对 AI 的不适感并非源于个人适应能力的失败,而是设计过程具有排他性的信号。
迈向一个真正对齐的未来需要:
- 认可生活经验: 承认实际用户和被 AI 取代的人才是关于对齐真理的主要来源,而不仅仅是实验室内部的代理。
- 拒绝二元论: 超越“安全性 vs. 加速”的辩论,转而询问谁在决定价值观时身处其间。
- 拥抱相互变化: 接受我们将被我们构建的技术所改变,并专注于如何自觉地而非被动地引导这种转型。
对齐不应是一套强加于机器以使其对人类安全的约束。相反,它应是一个共同发现的过程——一种让渡人类与 AI 共同进化成某种两者都无法单独实现的成果的方式。