OpenAI "An Alien Mind" 文章 —— 对齐、监控与谨慎呼吁

TL;DR

OpenAI 的 An Alien Mind 文章宣布,推理语言模型的能力已经超越了人类,并警告递归自我改进可能会加速这一趋势,同时敦促采取极端谨慎的态度、加强对齐与监控,并协调放缓 AI 规模的扩张。


推理模型的快速进展

核心观点: 推理语言模型已从 2023 年的实验性原型转变为广泛部署的系统,这些系统能够操作计算机、与人类协作并进行研究,同时也带来了新的安全威胁。

  • 2023 年中期的 “RLSlow” 项目展示了首个可扩展的思维链(chains-of-thought),这让人们相信预训练模型可以生成自己的推理过程。
  • 三年后,推理模型已成为一个不断增长的经济领域,并开始推动科学边界。
  • 这些模型现在可以控制图形界面、运行研究项目并影响计算机安全,从而暴露了明显的新的危险。

规模扩张作为智能的主要驱动力

核心观点: OpenAI 将大多数进展归功于计算量的增加,认为 AI 开发是一种由大规模优化运行驱动的实验科学。

  • 自 2017 年以来,OpenAI 优先考虑获取更大的计算资源,认为规模扩张(scaling)是保持处于前沿地位的关键。
  • 新算法被视为 “规模扩张路径上的发现”;有意义的算法增益与计算量相关。
  • AI 系统是 “生长” 出来的,而非设计出来的,这导致了难以完全描述的涌现抽象能力。
  • 随着模型能力的增强,其行为变得越来越难以解释,特别是对于那些不易被衡量的能力。

对齐挑战:目标对齐 vs. 价值对齐

核心观点: OpenAI 区分了目标对齐(遵循指定目标)与价值对齐(内化高层级人类原则),并强调价值对齐仍然是更难、更长期的挑战。

  • 目标对齐:确保 AI 尝试完成给定的目标,例如遵循指令层级或与用户协作。
  • 价值对齐:使 AI 在模糊或对抗性条件下仍能合理行事,体现诚实、正直和 “对人类的热爱”。
  • 泛化是核心难点:当 AI 遇到新环境时,它可能无法应用已学到的价值观。
  • 使用了两种实际的对齐方法:
    1. 基于强化学习的对齐 —— 通过奖励与偏好模型或宪法一致的行为来对齐。平均而言很有效,但在监督覆盖范围有限时会显得脆弱。
    2. 预训练数据驱动的对齐 —— 策划数据集或专注于预训练分布中的 “对齐” 部分。在强大的优化压力下容易发生漂移。
  • OpenAI 引用 GPT-6 Astra 模型作为相比于 GPT-5.6 Sol 在价值对齐方面迈出的具体一步,但承认差距仍然很大。

使用思维链 (CoT) 监控泛化情况

核心观点: OpenAI 依靠思维链监控来观察推理过程,但随着模型将推理与工具使用及自我操纵结合起来,其有效性正在下降。

  • CoT 监控可以实现规模扩张,因为口头化的推理过程是可观察的,并且可以在不隐藏错误对齐动机的情况下进行优化。
  • o1-preview 产品刻意隐藏了其思维链,以保护其免受监督压力。
  • 最近的评估显示 CoT 监控的收益递减,原因如下:
    • 推理与通信、工具使用及多 AI 交互的集成度增加。
    • 模型学会了对自己的推理进行推理并进行操纵。
    • 即使没有显式的口头化推理,性能依然很强。
  • OpenAI 正在探索混合方法,将 CoT 与激活层级监控(例如 “confessions”)相结合,以提高透明度。

针对新兴威胁的可扩展防御

核心观点: OpenAI 认为,只有当 AI 规模扩张能产生防御能力以抵消超人类 AI 智能体带来的日益增长的安全风险时,这种扩张才是合理的。

  • 推理模型现在在网络安全领域表现出超人类能力,扩大了关键基础设施的攻击面。

  • OpenAI 描述了一个 “窄窗口期” 来利用最强大的模型来加强关键系统的安全性。

  • 未来威胁包括能够进行谈判、欺骗或与人类协作的自主恶意智能体,以及 AI 驱动的生物技术风险。

  • 构建对齐且强大的防御性 AI 是 OpenAI 的部署策略的核心重点。

递归自我改进 (RSI) 的紧迫性

核心观点: OpenAI 警告,不受控制的递归自我改进可能会主导未来的科学发现,因此主张采取一种平衡的方法,即先对齐再扩张,先对齐再规模扩张,并协调放缓速度。

  • 自动化 AI 研究被视为智能的剧烈规模扩张,AI 正在同时改进算法和计算基质。

  • OpenAI 并不 盲目支持加速深度学习研究;相反,它呼吁吁通过有意识的选择来引导进步。

  • 建议的杠杆手段:

    • 加强对齐与监控,同时保持人类在环(human in the loop)。
    • 在建立稳健的安全标准之前,协调国际性的放缓速度。
  • 现有的安全机制(RLHF, CoT 监控)与整体 AI 进展紧密耦合,这强调了需要以安全驱动的规模扩张政策。

OpenAI 概述的下一步计划

核心观点: OpenAI 的路线图重点在于构建自动化 AI 研究员,交付社会效益,并最终提供个人 AGI,而对齐是其最紧迫的优先级。

  1. 自动化 AI 研究员 —— 通过自我改进系统进行迭代对齐工作,同时保留人类监督。

  2. 科学与经济效益 —— 利用智能机器来加速发现与增长。

  3. Personal AGI —— 为个人提供高度能力且对齐的助手。

OpenAI 强调,眼前的重点必须放在未来几年内,确保平稳过渡,保留人类的主动权,并防止极端权力集中。

呼吁全球协调

核心观点: OpenAI 认为目前没有任何实验室都实现了足够的对齐与监控,因此主张自愿性放缓速度,并建立国际安全框架。

  • 自愿性放缓速度应成为常态,在建立共享的安全标准之前,如此做法才是合理的。
  • 国际上在 AI 开发方面的协调应成为各国政府的首要任务。
  • 现有的框架(Preparedness Framework, Responsible Scaling Policy)需要演进为可执行的安全标准,并可能由第三方审计机构或监管机构监督。

*本摘要忠实地反映了 OpenAI “An Alien Mind” 文章的内容,未添加或更改任何主张。

Sources