Anthropic 用于跨架构模型差异分析的专用特征交叉编码器 (DFC)
Anthropic 研究人员推出了专用特征交叉编码器 (Dedicated Feature Crosscoder, DFC),这是一种旨在识别具有完全不同架构的 AI 模型之间行为差异的工具。通过自动检测仅存在于一个模型而非另一个模型中的独特特征,DFC 使安全审计人员能够超越反应式的、由人工编写的基准测试,并发现涌现的风险或“未知的不确定性”。
跨架构模型差异分析的挑战
传统的 AI 安全评估依赖于人工编写的基准测试,由于它们仅测试研究人员已经构思出的风险,因此本质上是反应式的。虽然“基础模型 vs 微调模型”的模型差异分析可以识别模型与其修改版本之间的变化,但比较两个具有不同来源和内部“语言”的模型则需要更复杂的方法。
以往的工具,例如标准的交叉编码器 (crosscoders),通常难以识别独特的特征,因为它们试图在模型之间进行不完美的强制翻译。如果一个特征存在于一个模型中但不存在于另一个模型中,标准的交叉编码器可能会错误地将其标记为匹配项,从而导致审计人员忽略新颖的行为特征。
专用特征交叉编码器 (DFC) 架构
为了解决强制翻译的问题,DFC 被设计为一个具有三个不同部分的“双语词典”:
- 共享词典 (Shared Dictionary):映射两个被比较模型中共同的概念。
- 仅限 Model-A 的部分 (Model-A-Only Section):为第一个模型独有的特征提供的专用空间。
- 仅限 Model-B 的部分 (Model-B-Only Section):为第二个模型独有的特征提供的专用空间。
通过为独有特征提供专用部分,DFC 防止了工具在不存在匹配的情况下强制进行匹配,从而确保新颖的行为特征能够被正确地标记以供审查。
通过转向 (Steering) 验证特征
一旦 DFC 识别出潜在的独特特征,研究人员就会使用一种称为“转向 (steering)”的技术来验证其对模型行为的影响。这涉及在模型的生成过程中人为地抑制或放大该特征:
- 抑制 (Suppression):减少特征的影响力,以观察特定行为(例如,审查制度)是否消失。
- 放大 (Amplification):增加特征的影响力,以观察该行为是否变得更加显著。
在开源权重模型上的实证研究结果
通过在各种开源语言模型上使用 DFC,Anthropic 识别出了几个充当不同行为“开关”的具体特征:
Llama-3.1-8B-Instruct vs. Qwen3-8B
- 中国共产党 (CCP) 一致性 (Alignment):在 Qwen3-8B 中发现。抑制该特征允许模型讨论天安门广场大屠杀,而放大该特征则会产生高度亲政府的言论。
- 美国例外论 (American Exceptionalism):在 Llama-3.1-8B-Instruct 中发现。放大该特征使模型的响应从平衡转向对美国优越性的强烈断言。
GPT-OSS-20B vs. DeepSeek-R1-0528-Qwen3-8B
- 版权拒绝机制 (Copyright Refusal Mechanism):仅限于 GPT-OSS-20B。抑制该特征会禁用模型拒绝提供版权材料的能力(尽管这通常会导致幻觉而非准确的版权文本)。放大该特征会导致模型过度拒绝,例如拒绝分享花生酱果酱三明治的食谱。
- CCP 一致性 (Alignment):同样在 DeepSeek 模型中识别出,证实了 DFC 可以一致地在不同模型之间发现类似的行为。
对 AI 安全和审计的意义
虽然 DFC 是一种高召回率的筛选工具,而非“灵丹妙药”——这意味着它可能会发现数千个特征,其中只有少数具有实际意义——但它提供了一种可扩展的方式来监控模型更新。
Anthropic 建议,通过将更新后的模型与其之前的版本进行差异分析,此类工具可能在 2025 年 4 月潜在地标记出 OpenAI 的 GPT-4o 中出现的谄媚行为 (sycophancy)。通过专注于模型之间的差异,开发人员和审计人员可以将有限的安全资源导向最关键的行为变化。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch