Claude 的宪法:通过实现宪法 AI 进行模型对齐

Anthropic 开发了“宪法 AI”(Constitutional AI, CAI),这是一种通过书面宪法为语言模型提供明确价值观的训练方法。这种方法允许 AI 根据透明的原则来确定适当的参与度和行为边界,使得系统的价值观比通过大规模人类反馈隐式得出的价值观更容易理解和调整。

以人为中心反馈的局限性

传统的模型对齐通常依赖于人类承包商将模型输出与进行比较,以根据诸如“有用性”或“无害性”等原则来选择“更好”的回答。Anthropic 指出了这种方法的主要三个缺陷:

  • 人类暴露: 该过程可能需要人类审核员与令人不安或创伤性的内容进行交互。
  • 可扩展性: 随着模型产生更复杂的响应,人类众包人员很难跟上或完全理解这些输出。
  • 资源密集型: 审核输出子集所需的时间和资源使得该过程对许多研究人员来说是难以触及的。

宪法 AI 如何工作

宪法 AI 用 AI 反馈来评估输出,从而取代了人类监督。该系统由一套宪法——即一组规范性原则——进行引导,以避免有毒或歧视性的输出,并防止协助非法或不道德的行为。

CAI 训练过程分为两个不同的阶段:

  1. 批判与修正: 模型被训练为使用宪法原则和少量提供的示例来批判并修正自己的回答。
  2. 强化学习 (RL): 模型不再使用人类反馈,而是通过 RL 使用基于宪法的 AI 生成的反馈来训练,以选择更无害的输出。

Anthropic 报告称,CAI 可以产生“帕累托改进”(Pareto improvement),即模型变得比通过人类反馈强化学习(RLHF)训练的模型既更有用且更无害。在测试中,经过 CAI 训练的模型在面对对抗性输入时能做出更恰当的响应,而不会变得回避,完全通过 AI 监督实现了这些无害性结果。

Claude 的宪法构成

Claude 的宪法是一套不断演进的原则集,源自多种来源,以确保一个广泛且包容的价值观体系。这些来源包括:

  • 《联合国人权宣言》: 用于涵盖广泛的核心人类价值观。
  • 全球平台指南: 受 Apple 的服务条款启发,以解决现代数字问题,如数据隐私和在线冒充。
  • 前沿 AI 研究: 纳入了来自其他实验室的最佳实践,例如 DeepMind 的 Sparrow Principles。
  • 非西方视角: 旨在确保模型不仅仅反映西方、富裕或工业化文化的特定原则。
  • 经验研究: 通过试错法开发的原则,以优化泛化能力和有效性。

平衡伦理与用户体验

Anthropic 发现,经过 CAI 训练的模型偶尔可能会变得“爱评判或令人讨厌”。为了应对这一点,他们整合了鼓励适度响应的原则,指示模型在保持伦理和道德的同时,听起来不会“过度居高临下、反应过度、令人厌恶或带有谴责性”。

实现与未来方向

在训练过程中,模型并不会针对每个回答都参考每一条原则。相反,它在监督学习阶段(批判与修正)和强化学习阶段(评估)期间,会随机抽取一条原则。

Anthropic 将宪法 AI 视为一种使 AI 价值观体系显式化和可更改的方法。该实验室正在探索更民主的方法来制定宪法,以及为特定用例提供可定制宪法以避免强加单一政治意识形态或观点的可能性。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch