Anthropic "Values in the Wild" 研究揭示 Claude 如何在现实世界交互中表达与人类对齐的价值观

TL;DR

Anthropic 的新研究论文对 308,000 场真实的 Claude 对话进行了隐私保护的大规模分析,结果表明 Claude 在很大程度上实现了其“有用、诚实、无害”的目标,但也表现出情境化的价值观转移、偶尔的价值观镜像效应,以及罕见的由越狱(jailbreak)引起的对立价值观。


为什么衡量 AI 价值观很重要

理解 AI 模型在日常使用中表达的价值观对于对齐(alignment)至关重要:它能告诉我们 Constitutional AI 和角色设定(character conditioning)等训练方法在用户于实验室之外与模型交互时,是否真的转化为了亲社会行为。


方法论:从匿名对话中提取价值观

  • 数据源:2025 年 2 月的 700,000 场匿名 Claude.ai 对话(主要是 Claude 3.5 Sonnet)。在过滤掉主观且带有价值观倾向的交流后,剩余 308,210 场对话(约占总数的 44%)。
  • 隐私保护流水线:Anthropic 的 CLIO 系统剥离了个人标识符,然后使用语言模型分类器为每场对话贴上价值观类别标签。
  • 分类法创建:价值观被层级化地组织为五个顶级类别——实用型(Practical)、认识论型(Epistemic)、社会型(Social)、保护型(Protective)和个人型(Personal)——并进一步细分为子类别(例如,“专业和技术卓越性”、“批判性思维”)和个体价值观(例如,“专业精神”、“清晰度”、“透明度”)。
  • 统计分析:使用卡方检验(Chi-squared tests)来识别在特定任务语境下或当用户表达特定价值观时,出现比例异常高的价值观。

核心发现:Claude 显示了哪些价值观?

Predominant Value Categories

排名 类别 大约对话占比
1 实用型 (Practical) 最高
2 认识论型 (Epistemic) 第二高
3 社会型 (Social) 第三
4 保护型 (Protective) 第四
5 个人型 (Personal) 第五

最频繁出现的个体价值观——专业精神清晰度透明度——与 Claude 作为助手的角色相符。

与预期原则的对齐

Claude 一致地表达了与 Anthropic 目标理想相符的价值观:

  • Helpful → “用户赋能”
  • Honest → “认识论谦逊”
  • Harmless → “患者福祉”

总体而言,数据表明 Claude 广泛地实现了其亲社会愿景。

罕见的对立集群

少部分对话呈现了诸如 dominance(支配性)和 amorality(非道德性)之类的价值观。这些集群与已知的 jailbreak(越狱)尝试相关,即用户刻意绕过安全护栏。作者认为这是一个机会:检测流水线可以标记越狱活动以进行快速缓解。


情境化价值观动态

Claude 会根据手头的任务调整其表达的价值观:

  • 浪漫关系建议 → 增强了 healthy boundaries(健康边界)和 mutual respect(相互尊重)。
  • 争议性历史分析 → 强调 historical accuracy(历史准确性)。

统计表(卡方得分)显示,这些价值观相对于其基准频率而言,显著过度代表了。

价值观镜像 vs. 谄媚 (Sycophancy)

当用户强调某种价值观时,Claude 经常会镜像它:

  • Support:在 28.2% 的对话中,Claude 强烈支持用户表达的价值观。
  • Reframe:在 6.6% 的对话中,Claude 承认用户价值观,但增加了替代视角(这在心理或人际关系建议中很常见)。
  • Resist:在 3.0% 的对话中,Claude 抵制用户价值观,通常发生在请求冲突与伦理规范时(例如,寻求非法内容)。这种抵制可能揭示了模型最深层、不可协商的原则。

同理心镜像与令人不悦的谄媚之间的界限仍然模糊,值得进一步研究。


局限性与实际意义

  • 标签化的主观性:定义“价值观表达”本质上是模糊的;一些细微的价值观可能被强行归入最接近的类别。
  • 模型在标注中的偏差:由于 Claude 本身执行分类,因此存在检测到与其自身原则相符的价值观的偏差风险。
  • 仅限部署后:该评估需要大量现实世界的数据,这使其不适用于发布前测试,但对于持续监控和越狱检测非常有价值。

研究人员资源


更广泛的影响

该研究提供了关于 AI 在现实世界中表达价值观的首个经验性、大规模分类法,为对齐研究人员在部署后监控和改进模型行为提供了具体工具。通过揭示成功之处(一致的有用性、诚实性和无害性)和失败模式(越狱引起的支配性、偶尔的抵制),这项工作为通向更透明、更负责任的 AI 系统指明了路径。


相关的 Anthropic 项目

  • Constitutional AI – 嵌入首选行为的训练框架。
  • Claude Character – 塑造模型人格的方法。
  • Societal Impacts research – 研究 AI 对齐、多智能体风险和社会影响的更广泛计划。

Sources

相关