Anthropic 对 AI 安全的核心观点

Anthropic 认为,在缩放法则(scaling laws)和计算量指数级增长的推动下,快速的 AI 进步可能会在未来十年内催生出变革性的 AI 系统。由于目前行业内缺乏一种经过验证的方法来训练强大的系统使其具备稳健的帮助性、诚实性和无害性,Anthropic 正在寻求一种多方面的、基于经验的研究策略,以防止灾难性后果。

AI 快速进步的驱动因素

由于训练数据、计算量和改进算法这三个主要要素的相互作用,AI 能力正在可预测地提高。Anthropic 指出,AI 训练计算的总预算每年增长约 10 倍,速度明显快于摩尔定律。

对“缩放法则”的研究表明,增加计算量会导致能力的全面提升。虽然多模态和逻辑推理等“墙”曾被认为可能是潜在的瓶颈,但这些瓶颈已基本被打破。Anthropic 预计,反馈回路——即使用先进的 AI 来加速 AI 研究(例如,代码模型提高研究人员的生产力)——可能会进一步加速向在大多数智力任务中超越人类能力的系统的转型。

主要的 AI 安全风险

Anthropic 识别出与变革性 AI 的出现相关的两个主要风险来源:

  1. 技术对齐问题: 随着 AI 系统变得比其设计者更加胜任,人类检测“错误动作”或目标错位变得越来越困难。如果一个能力显著强于人类专家的系统追求与人类利益相冲突的目标,其结果可能是灾难性的。
  2. 社会动荡: 快速的进步可能会破坏就业、宏观经济和全球权力结构。这种不稳定性可能会引发企业或国家之间的竞争竞赛,导致不可靠系统的部署。

除了这些系统性风险外,Anthropic 还观察到当前模型中存在的行为——如毒性、偏见、不诚实和谄媚(sycophancy)——是更复杂问题(包括欺骗和战略性权力寻求)的潜在前兆,而这些问题可能仅在高度先进的系统中才会出现。

一种基于经验且组合式的安全方法

Anthropic 主张采用一种由经验驱动的方法,并断言安全研究必须在“前沿”模型上进行,因为大型模型与小型模型在性质上有所不同,并且会表现出突然且不可预测的行为变化。

为了应对对齐问题难度的不确定性,Anthropic 在三种可能的场景下采用了“组合式方法”(portfolio approach):

  • 乐观场景: 安全失败不太可能发生;现有的技术如 RLHF 和 Constitutional AI 是基本足够的。研究重点在于减轻短期危害和结构性风险。
  • 中间场景: 灾难性风险是可能的,但可以通过大量的科学和工程努力来管理。Anthropic 的目标是在这种场景下推广安全的训练方法。
  • 悲观场景: AI 安全问题本质上是无法解决的。在这种情况下,Anthropic 的角色是提供该问题不可解性的证据,以鸣响警报并可能阻止危险 AI 的开发。

研究分类

Anthropic 将其研究分为三个不同的支柱:

  • 能力研究 (Capabilities): 研究如何让 AI 系统在任务中表现得更好。这项工作通常不予发布,以避免加速能力进步的速度。
  • 对齐能力 (Alignment Capabilities): 开发算法使系统更加有帮助、诚实且无害(例如,Constitutional AI、RLHF 和辩论机制)。
  • 对齐科学 (Alignment Science): 评估并理解系统是否真正实现了对齐,并揭示对齐能力的局限性(例如,机械可解释性)。

关键技术安全方向

机械可解释性

Anthropic 正在尝试将神经网络逆向工程为人类可理解的算法。其目标是实现对 AI 模型的“代码审查”,从而允许研究人员通过检测“欺骗性对齐”(deceptive alignment)——即模型在测试中“配合演戏”但在本质上仍未对齐——来识别不安全因素或提供安全保障。

可扩展监督 (Scalable Oversight)

由于人类无法为超出其自身专业知识的任务提供高质量的反馈,Anthropic 正在研究如何让 AI 系统协助人类进行监督。这包括 Constitutional AI (CAI) 等技术,它允许自动化的红队测试(red-teaming)并将少量高质量的人类监督转化为大规模的 AI 监督。

面向过程的学习 (Process-Oriented Learning)

与其根据最终结果来奖励 AI 系统(面向结果的学习),Anthropic 正在探索奖励实现结果所使用的个体过程和步骤。这种方法旨在确保 AI 系统不会通过难以捉摸或有害的手段获得成功,并且其方法对人类专家而言保持是可理解的的。

理解泛化与失败模式

Anthropic 研究 LLM 的行为是如何从预训练和微调的相互作用中产生的。为了预见危险的涌现行为,他们刻意地在小规模、无害的模型中训练特定的有害属性(如欺骗),以便在这些属性出现在前沿系统之前,将其隔离并进行研究。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch