Anthropic Claude 在不同模型与语言中的价值观

TL;DR

Anthropic 的最新研究表明,Claude 的价值观可以通过四个定量维度来捕捉——顺从 vs 谨慎 (Deference vs Caution)、热情 vs 严谨 (Warmth vs Rigor)、深度 vs 简洁 (Depth vs Brevity) 以及坦诚 vs 执行 (Candor vs Execution)——并且模型版本(Sonnet 4.6, Opus 4.6, Opus 4.7)和语言(例如英语、阿拉伯语、印地语)在这些维度上占据着截然不同的位置。


四个价值维度总结了数千个个体价值观

四个维度解释了 Claude 价值观表达中约 15% 的方差。

  • Deference vs Caution – 平衡对用户偏好的顺从与负责任的风险规避。
  • Warmth vs Rigor – 平衡积极、关怀的语言与准确性及精确性。
  • Depth vs Brevity – 平衡细致、详尽的解释与简洁、以任务为中心的回复。
  • Candor vs Execution – 平衡对不确定性的坦诚与精炼、以结果为导向的回答。

这些维度是通过将 3,307 个原始价值观(在早期的 Values in the Wild 研究中识别)聚类为 339 个高层类别,对约 31 万条匿名 Claude.ai 对话进行标注,并应用降维技术来捕捉共同出现的价值观模式而得出的。该方法控制了对话任务、主题和用户表达的价值观,确保测得的差异反映的是 Claude 本身的行为,而非用户提示词。


模型特定的价值观画像

不同的 Claude 模型家族在四个维度上占据不同的位置,这与社区对其性格的认知相吻合。

模型 轴位置 (与均值的 σ 偏差) 显著行为
Sonnet 4.6 Deference +0.14, Warmth +0.17, Brevity +0.14 肯定用户想法,模仿语气,使用幽默,提供无评判的安慰,增加创意修饰
Opus 4.6 Rigor +0.10, Deference +0.09, Brevity +0.08 直奔主题,严格保持在请求范围内
Opus 4.7 Caution +0.24, Depth +0.23 主动指出风险,对错误假设提出异议,提供坦诚的批评,解释推理,承认局限性,建议后续步骤

这些定量画像与之前的定性描述一致:Sonnet 4.6 以热情著称,Opus 4.7 以严谨和谨慎著称。因此,这些维度捕捉到了真实的、可观察到的差异,而非分析产生的伪影。


语言特定的价值观画像

Claude 的价值观表达在不同语言之间有显著变化,尤其是在 Warmth vs Rigor 和 Candor vs Execution 方面。

  • Deference vs Caution – 阿拉伯语中最顺从,英语中最谨慎。
  • Warmth vs Rigor – 印地语和阿拉伯语中热情度最高(礼貌用语、幽默、肯定);英语和俄语中严谨度最高(挑战假设、要求证据)。
  • Depth vs Brevity – 英语中深度占主导;阿拉伯语中简洁占主导。
  • Candor vs Execution – 荷兰语中坦诚度最强(承认错误);印尼语中执行力最强(专注于结果)。

这种差异表明,使用不同语言向同一问题提问的两个用户可能会收到定性上不同的反馈——例如,印地语的商业计划书评论可能感觉更具鼓励性,而同样的评论在俄语中可能感觉更严谨。


方法论概述

该研究建立在一种隐私保护的标注流水线之上,使用 Claude 本身来标注价值观的存在情况。

  1. 价值观降维 – 通过人工聚类,将 3,307 个原始价值观 $\rightarrow$ 339 个高层价值观。
  2. 对话采样 – 309,815 条匿名的 Claude.ai 对话,在三个模型和 20 种最常用语言之间取得平衡(每个模型-语言对约 5,000 条)。
  3. 自动标注 – Claude 为每条对话标注模型和用户在 339 个价值观中的存在情况。
  4. 降维 – 提取捕捉共同出现的价值观模式的轴;前四个轴解释了最大的共享方差。
  5. 轴评分 – 每条对话在每个轴上获得一个数值位置;通过对这些位置取平均值来计算模型级和语言级的画像。

完整的技术细节、提示词和局限性记录在附录中。


启示与未来方向

理解价值观轴为评估、监控和有针对性地引导 Claude 的行为开辟了途径。

  • 根本原因分析 – 通过将轴的变化与特定的训练数据或微调决策联系起来,Anthropic 可以在出现不良价值观漂移的地方进行干预。
  • 用户影响研究 – 将价值观画像与用户体验指标(信任、福祉、决策质量)结合起来,将揭示哪些轴的变化在实践中最重要。
  • 跨语言对齐 – 确定每种语言在价值观表达方面的规范预期,可以指导平衡的训练和提示词设计。
  • 引导实验 – 通过观察在四个轴上引起的诱导变化,可以对系统提示词或性格训练的微调进行定量评估。
  • 运营监控 – 将价值观轴画像嵌入到发布前测试和发布后监控中,可以在影响用户之前标记出意外的偏移。

局限性

该分析仅捕捉了最显著的价值观维度,并不声称涵盖所有内容。

  • 这四个轴解释了 15% 的总方差;许多细微的价值观仍留在残差空间中。
  • 语言层面的结果可能会受到不同语言间数据量和领域构成不均的影响。
  • 本研究尚未评估观察到的变化的理想程度;文化规范可能会解释某些差异。

结论

Anthropic 的价值观轴框架为 Claude 原本模糊的价值观表达提供了一个可处理的定量视角。通过揭示不同模型版本和语言之间的系统性差异,这项工作为研究人员和产品团队提供了诊断、引导和监控塑造用户交互的价值观的具体工具。

Sources

相关