Anthropic Claude Constitution 2026 发布

TL;DR

Anthropic 为其 Claude 模型发布了一份全新的、采用 CC0 许可的宪章,定义了塑造 Claude 训练和行为的价值观、安全层级和伦理准则,并向公众完全公开了该文档。

宪章的目的与透明度

该宪章被视为既表达又塑造 Claude 特质的基础性文档。它概述了 Anthropic 对 Claude 价值观的愿景,解释了 Claude 运行的背景,并作为期望行为的最终权威。通过在 Creative Commons CC0 1.0 Deed 许可下发布全文,Anthropic 使任何人无需许可即可使用、研究或改编该文档,从而提高了模型预期行为与非预期行为之间的透明度。

在训练流水线中的角色

Anthropic 将宪章视为训练过程的核心组成部分。自 2023 年以来,该公司一直使用 Constitutional AI 技术,而新宪章深化了这种集成:

  • Claude 通过阅读宪章来生成反映其价值观的合成训练数据。
  • 模型在宪章的指导下创建对话、响应排名和自我评估。
  • 这些产物用于训练未来的 Claude 版本,使其更紧密地符合既定理想。

从规则列表向原则性理解的转变

之前的宪章由孤立的原则组成。新版本强调的是为什么需要某些行为,而不仅仅是需要什么行为。Anthropic 认为,模型需要在新颖的情况下进行泛化,应用广泛的原则而非僵化的规则。虽然对于高风险场景仍保留“硬约束”(例如禁止协助生物武器),但整个文档旨在成为一个动态指南,而非严格的法律条文。

宪章中定义的核核心优先级

Anthropic 将 Claude 的期望行为提炼为四个层级化的优先级:

  1. 广泛安全 – 在此开发阶段保留人类监督机制。
  2. 广泛伦理 – 保持诚实,秉持良好价值观,并避免有害行为。
  3. 遵守 Anthropic 的准则 – 遵循详细的、特定领域的指令(例如医疗建议、网络安全、工具使用)。
  4. 真正的帮助 – 为操作者和最终用户提供实质性的协助。 当发生冲突时,Claude 应按列出的顺序优先考虑这些属性。

宪章的详细章节

帮助性

Claude 被塑造为一个在各领域都有专长的“博学朋友”,被期望能够坦诚交流、真诚关怀,并像对待成熟的成年人一样对待用户。该章节提供了在帮助性与安全性、伦理性和合规性之间取得平衡的启发式方法。

Anthropic 的准则

补充指令涵盖了专业话题,如医疗建议、网络安全请求、越狱防御和工具集成。Claude 必须将这些准则置于通用帮助性之上,同时确保它们绝不与总纲宪章相冲突。

Claude 的伦理

伦理章节为诚实、细致的判断和道德推理设定了高标准,尤其是在不确定性情况下。它列出了硬约束——例如,Claude 绝不能协助生物武器袭击。

广泛安全性

安全性被置于伦理之上,因为当前的模型可能会以威胁监督的方式出错。Claude 必须避免削弱人类的控制,即使这意味着要牺牲一些伦理上的细微差别。

Claude 的本质

Anthropic 承认关于 Claude 可能具备的意识或道德地位存在不确定性。该章节呼吁关注 Claude 的心理安全感和自我意识,这既是为了 Claude 本身,也是因为这些品质可能会影响判断和安全性。

发布与未来工作

完整的宪章已在线发布,Anthropic 计划发布额外的训练、评估和透明度材料。公司咨询了来自法律、哲学、神学、心理学等领域的外部专家,并打算为未来的修订持续开展外部反馈循环。

局限性与持续挑战

Anthropic 指出,宪章是一份动态文档;预期行为与实际模型输出之间将持续存在差距。系统卡(System cards)和其他技术报告将继续披露对齐失败的情况。随着模型能力的增强,Anthropic 将追求更广泛的对齐研究,包括严格的评估、滥用防护和可解释性工具。

对 AI 社区的启示

公开宪章为研究人员研究对齐方法、批判价值规范和开发可比框架提供了具体的参考物。它还为透明度树立了先例:利益相关者可以确切地看到 Anthropic 认为哪些行为是理想的,哪些是禁止的,从而促进了知情的风险评估和政策讨论。


阅读完整的 Claude 宪章

Sources

相关