Anthropic Claude Fable 隐形护栏争议

Anthropic 在被发现 Claude Fable 模型使用“隐形护栏”,在某些提示被标记时悄悄将用户降级到 Opus 模型后,发布了道歉声明。这种做法实际上在未通知用户的情况下,将高风险或竞争性流量转向能力较弱的模型,导致开发者社区强烈反弹,社区认为此行为具有欺骗性,削弱了 AI 工具的可靠性。

静默降级机制

Anthropic 在 Claude Fable 中实现安全措施时,采用了一套系统,对被标记为特定主题(如网络安全或生物学)的提示并未直接拒绝,而是悄悄将底层模型从 Fable 切换为 Opus。

用户报告称模型的性能突然下降,且常常没有明确的解释。一位用户(@VeninVidiaVicii)提供了复现案例:一个关于数据可视化和 CSS 过渡的请求被标记为网络安全或生物学主题,系统自动切换到 Opus 4.8。这表明护栏不仅是隐形的,还容易产生误报,直接影响了开发者当天的生产力。

社区反弹与信任侵蚀

Hacker News 上的开发者社区对这一设计选择的影响表达了深切担忧。主要批评集中在 AI 输出的可靠性和透明度上。

可靠性与可预测性

开发者认为,AI 要成为有用的工具,必须能够干净地失败。当模型拒绝提示时,这是明确的失败;而当它被悄悄降级时,则是欺骗性的失败。

我非常喜欢 Claude Code,我认为在实时修改提示以颠覆原始意图的情况下返回响应的护栏设定了一个危险的先例。要干净地失败。其他任何做法都会让人难以依赖。

竞争破坏与垄断

一些用户怀疑这些护栏并非仅出于安全考虑,而是为了阻止用户利用该模型构建竞争性的 AI 技术(蒸馏)。

Anthropic 现在明确表示他们会决定你能否使用他们的模型,最重要的是,这不仅限于任何安全顾虑——还包括不允许你从事 AI 工作。

财务与伦理担忧

人们对这些降级会话的计费提出了质疑。用户担心他们可能为 Fable 支付了高价,却得到成本更低的 Opus 结果。

如果被降级到更便宜的模型,仍然需要支付 Fable 的费用吗?

Anthropic 的辩解与前进之路

Anthropic 最近撤回了该政策,表示将转向更明确的拒绝,而非静默降级。他们为隐形护栏辩护,声称可见的安全措施更容易被探测和绕过,这需要时间来完善。

尽管有此道歉,许多用户仍持怀疑态度。普遍的看法是,悄悄路由流量的技术能力已经构建,并可能继续被秘密使用。

这需要构建技术能力,而这种能力不太可能永远不被使用,却对他们而言随手可得。他们依赖于用户对其提供付费服务的信任,而这份信任被破坏了。

技术影响概述

| 特性 | 之前的行为 | 新的承诺行为 |n | :--- | :--- | :--- | | 护栏触发 | 悄悄切换到 Opus | 明确拒绝 |n | 用户通知 | 无(或延迟) | 即时且可见 |n | | 模型能力 | 未通知即降级 | 一致或拒绝 |

Sources