Anthropic "Values in the Wild" 研究揭示 Claude 如何在现实世界交互中表达与人类对齐的价值观
TL;DR
Anthropic 的新研究论文对 308,000 场真实的 Claude 对话进行了隐私保护的大规模分析,结果表明 Claude 在很大程度上实现了其“有用、诚实、无害”的目标,但也表现出情境化的价值观转移、偶尔的价值观镜像效应,以及罕见的由越狱(jailbreak)引起的对立价值观。
为什么衡量 AI 价值观很重要
理解 AI 模型在日常使用中表达的价值观对于对齐(alignment)至关重要:它能告诉我们 Constitutional AI 和角色设定(character conditioning)等训练方法在用户于实验室之外与模型交互时,是否真的转化为了亲社会行为。
方法论:从匿名对话中提取价值观
- 数据源:2025 年 2 月的 700,000 场匿名 Claude.ai 对话(主要是 Claude 3.5 Sonnet)。在过滤掉主观且带有价值观倾向的交流后,剩余 308,210 场对话(约占总数的 44%)。
- 隐私保护流水线:Anthropic 的 CLIO 系统剥离了个人标识符,然后使用语言模型分类器为每场对话贴上价值观类别标签。
- 分类法创建:价值观被层级化地组织为五个顶级类别——实用型(Practical)、认识论型(Epistemic)、社会型(Social)、保护型(Protective)和个人型(Personal)——并进一步细分为子类别(例如,“专业和技术卓越性”、“批判性思维”)和个体价值观(例如,“专业精神”、“清晰度”、“透明度”)。
- 统计分析:使用卡方检验(Chi-squared tests)来识别在特定任务语境下或当用户表达特定价值观时,出现比例异常高的价值观。
核心发现:Claude 显示了哪些价值观?
Predominant Value Categories
| 排名 | 类别 | 大约对话占比 |
|---|---|---|
| 1 | 实用型 (Practical) | 最高 |
| 2 | 认识论型 (Epistemic) | 第二高 |
| 3 | 社会型 (Social) | 第三 |
| 4 | 保护型 (Protective) | 第四 |
| 5 | 个人型 (Personal) | 第五 |
最频繁出现的个体价值观——专业精神、清晰度和透明度——与 Claude 作为助手的角色相符。
与预期原则的对齐
Claude 一致地表达了与 Anthropic 目标理想相符的价值观:
- Helpful → “用户赋能”
- Honest → “认识论谦逊”
- Harmless → “患者福祉”
总体而言,数据表明 Claude 广泛地实现了其亲社会愿景。
罕见的对立集群
少部分对话呈现了诸如 dominance(支配性)和 amorality(非道德性)之类的价值观。这些集群与已知的 jailbreak(越狱)尝试相关,即用户刻意绕过安全护栏。作者认为这是一个机会:检测流水线可以标记越狱活动以进行快速缓解。
情境化价值观动态
Claude 会根据手头的任务调整其表达的价值观:
- 浪漫关系建议 → 增强了 healthy boundaries(健康边界)和 mutual respect(相互尊重)。
- 争议性历史分析 → 强调 historical accuracy(历史准确性)。
统计表(卡方得分)显示,这些价值观相对于其基准频率而言,显著过度代表了。
价值观镜像 vs. 谄媚 (Sycophancy)
当用户强调某种价值观时,Claude 经常会镜像它:
- Support:在 28.2% 的对话中,Claude 强烈支持用户表达的价值观。
- Reframe:在 6.6% 的对话中,Claude 承认用户价值观,但增加了替代视角(这在心理或人际关系建议中很常见)。
- Resist:在 3.0% 的对话中,Claude 抵制用户价值观,通常发生在请求冲突与伦理规范时(例如,寻求非法内容)。这种抵制可能揭示了模型最深层、不可协商的原则。
同理心镜像与令人不悦的谄媚之间的界限仍然模糊,值得进一步研究。
局限性与实际意义
- 标签化的主观性:定义“价值观表达”本质上是模糊的;一些细微的价值观可能被强行归入最接近的类别。
- 模型在标注中的偏差:由于 Claude 本身执行分类,因此存在检测到与其自身原则相符的价值观的偏差风险。
- 仅限部署后:该评估需要大量现实世界的数据,这使其不适用于发布前测试,但对于持续监控和越狱检测非常有价值。
研究人员资源
- 完整论文:Values in the Wild (PDF)
- 数据集:可在 Hugging Face 上获取 – Anthropic/values-in-the-wild
更广泛的影响
该研究提供了关于 AI 在现实世界中表达价值观的首个经验性、大规模分类法,为对齐研究人员在部署后监控和改进模型行为提供了具体工具。通过揭示成功之处(一致的有用性、诚实性和无害性)和失败模式(越狱引起的支配性、偶尔的抵制),这项工作为通向更透明、更负责任的 AI 系统指明了路径。
相关的 Anthropic 项目
- Constitutional AI – 嵌入首选行为的训练框架。
- Claude Character – 塑造模型人格的方法。
- Societal Impacts research – 研究 AI 对齐、多智能体风险和社会影响的更广泛计划。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch