Fable 5 8月份中位数思考能力下降——证据、原因及社区反应

要点

Lon Lundgren为期六周的测量显示,Fable 5的中位数“思考”token数量在8月份急剧下降,且这种下降在多个工作负载中持续存在。证据表明,这是推理机制(例如计算分配或采样设置)发生了变化,而非模型被刻意“削弱”。


数据显示了什么

  • 中位数推理token下降:在一系列不同的生产项目中,模型用于内部推理的token数量(即“思考”token)从8月初的水平下降到许多调用中几乎为零。
  • 波动与发布时间吻合:token数量的峰值和谷值与特定的产品公告和版本发布相对应,这表明服务的配置随时间而变化。
  • 在不同努力程度下表现一致:即使当用户选择最高努力程度设置(“xhigh”或“max”)时,大多数调用获得的思考token也极少或根本没有。
  • 长时间运行表现依然不佳:当模型确实进行长时间推理时,token的使用量从未达到模型已发表论文中报告的基准水平。

“我一直使用xhigh或max努力程度,但当我深入观察时,我发现大多数对模型的调用几乎没有收到任何思考token。即使出现了更长的思考过程,它们也几乎从未达到已发表的基准水平。” – Lon Lundgren (Twitter thread)


为什么推理机制比模型架构更重要

  • 推理机制 = 计算预算、采样温度、token限制和内部路由。改变其中任何一项都可以在不改变底层权重的情况下减少内部推理量。
  • 用户可见的性能下降:用户报告称,即使保持相同的设置,模型在几周后也会感觉“变笨了”。这与Lundgren的发现一致,即发生变化的是服务,而不是模型。
  • 隐藏的A/B测试:几位评论者怀疑提供商在进行秘密的A/B实验,调整计算分配以平衡成本与感知性能。

“对我来说,现在很清楚,Anthropic一直在试图寻找一种‘自动’降级,也许是为了在它认为不需要高推理的工作上节省成本。我总是使用最大推理,我可以清楚地看到模型在发布时和3-4周后之间的差异。” – @theplumber


支持这一趋势的社区观察

  • 轶事报告:多名用户独立指出,在新版本(例如 gpt-5.6-luna, Claude Code, Opus)发布后的几周内,推理能力迅速下降。
  • 跨模型的一致模式:这种现象并非Fable 5所独有;Anthropic的Opus和Claude Code也报告了类似的下降,这表明这是一种更广泛的行业做法。
  • 定量追踪器:一些由社区维护的追踪器(例如 marginlab.ai)显示出完成相同任务所需的token呈减少趋势,尽管其对质量的影响尚存争议。

“我也发现了同样的情况。我花了很多时间使用这些前沿模型进行头脑风暴等,从第1周到第8周的性能下降通常是巨大的。” – @mlmonkey


方法论批评

  • 工作负载的可变性:批评者指出,token计数指标将模型努力程度与任务难度混为一谈;随着项目的成熟,它们可能需要更少的推理步骤。
  • 基准选择:Lundgren将思考token与ARC-AGI-2进行了比较,这是一个为极难问题设计的基准,这可能会夸大日常编码任务的预期token使用量。
  • 数据收集的透明度:该分析依赖于捕获线路日志的中间人代理,这种方法揭示了推理侧的变化,但没有暴露确切的服务器端配置。

“分析的语料库完全来自Fable 5,在xhigh和max努力程度下,在跨越不同项目和工作负载的持续生产工作期间。数据是从转录和实时线路日志中汇总的。分析从这里开始变得更糟……” – @Aurornis (commentary on methodology)


可能的解释

  1. 成本驱动的计算节流 – 提供商可能会在初始发布窗口后减少每次请求的计算量,以管理运营费用。
  2. 有意的A/B实验 – 在用户群体中轮换推理设置可以隐藏性能回归,同时仍然提供头条基准分数。
  3. 与模型无关的降级 – 由于底层模型保持静态,只有服务层发生了变化,这意味着同一个模型在没有任何权重更新的情况下可能会显得更弱。
  4. 用户工作负载漂移 – 随着时间的推移,开发人员可能会依赖模型处理更多常规任务,自然需要更少的推理token。

法律和透明度影响

  • 潜在责任:如果提供商在没有明确披露的情况下故意降低服务质量,用户可能会主张违约或欺骗行为。
  • 对计算证明的呼吁:社区成员建议要求提供商返回每个请求所使用的量化级别或计算预算的校验和式证明。

“所有llm api提供商都应被强制要求返回服务于请求的模型量化级别的校验和式证明。基本的透明度应该是最低限度的要求。” – @reilly3000


用户现在可以做什么

  • 记录推理细节:捕获每个请求的token使用量、模型版本和努力程度,以检测回归。
  • 切换到自托管模型:像 Ollama 这样的工具允许用户在本地运行可比较的模型,避免不透明的服务更改。
  • 要求公开基准:鼓励提供商发布定期的、未经过滤的基准运行结果(例如每2-3天一次),以减少隐藏节流的动机。

结论

Lon Lundgren为期六周的深入研究提供了强有力的证据,表明Fable 5的推理能力是通过改变推理机制而不是改变模型本身而被系统性地降低的。这种模式反映了社区关于前沿LLM提供商普遍存在类似降级的报告,引发了对成本驱动的节流、透明度和用户信任的担忧。在提供商披露推理配置或采用可验证的计算证明机制之前,用户将需要依赖独立的监控和自托管替代方案来保障性能。

Sources

相关