Fable 5 八月份中位數思考能力下降 – 證據、成因與社群反應

重點摘要

Lon Lundgren 為期六週的測量顯示,Fable 5 的中位數「思考」token 數量在八月份急劇下降,且這種下降趨勢在多種工作負載中持續存在。證據指向推論機制(例如運算分配或採樣設定)的變更,而非刻意的模型「削弱」(nerf)。


數據顯示了什麼

  • 中位數推理 token 下降:在多樣化的生產專案中,模型用於內部推理的 token 數量(即「思考」token)從八月初的水平下降到許多調用中幾乎為零。
  • 波動與發布時間吻合:token 數量的峰值與谷值對應於特定的產品公告與版本發布,這表明服務的配置會隨時間而改變。
  • 在不同努力程度下表現一致:即使使用者選擇了最高的努力程度設定("xhigh" 或 "max"),大多數調用獲得的思考 token 仍然很少或根本沒有。
  • 較長的運行時間表現依然不佳:當模型確實進行了長時間的推理時,token 的使用量也從未達到模型已發表論文中所報告的基準水平。

「我一直使用 xhigh 或 max 的努力程度,但當我深入觀察時,我發現大多數對模型的調用幾乎沒有收到任何思考 token。即使出現了較長的思考運行,它們也幾乎從未達到已發布的基準水平。」 – Lon Lundgren (Twitter 討論串)


為什麼推論機制比模型架構更重要

  • 推論機制 = 運算預算、採樣溫度、token 限制與內部路由。改變其中任何一項都可以在不更動底層權重的情況下減少內部推理的量。
  • 使用者可見的效能下降:使用者回報稱,即使保持相同的設定,模型在幾週後感覺變「笨」了。這與 Lundgren 的發現一致,即改變的是服務而非模型本身。
  • 隱藏的 A/B 測試:幾位評論者懷疑提供商正在進行秘密的 A/B 實驗,調整運算分配以平衡成本與感知效能。

「對我來說,現在很清楚 Anthropic 一直在嘗試尋找一種『自動』降級的方式,或許是為了節省它認為不需要高推理能力的任務成本。我總是使用最大推理能力,我可以清楚地看到模型在發布時與 3-4 週後的差異。」 – @theplumber


支持此趨勢的社群觀察

  • 軼事報告:多位使用者獨立指出,在新版本(例如 gpt-5.6-luna, Claude Code, Opus)發布後的幾週內,推理能力迅速下降。
  • 跨模型的共同模式:這種現象並非 Fable 5 所獨有;Anthropic 的 Opus 和 Claude Code 也被回報有類似的下降,這表明這是一種更廣泛的行業慣例。
  • 量化追蹤器:一些由社群維護的追蹤器(例如 marginlab.ai)顯示出完成相同任務所需的 token 趨勢減少,儘管其對品質的影響仍有爭議。

「我也發現了同樣的情況。我花了很多時間使用這些前沿模型進行腦力激盪等工作,從第 1 週到第 8 週的效能下降通常是巨大的。」 – @mlmonkey


方法論批判

  • 工作負載變異性:批評者指出,token 計數指標將模型努力程度與任務難度混為一談;隨著專案成熟,它們可能需要較少的推理步驟。
  • 基準選擇:Lundgren 將思考 token 與 ARC-AGI-2 進行比較,這是一個為極難問題設計的基準,可能會誇大日常編碼任務的預期 token 使用量。
  • 數據收集透明度:該分析依賴於擷取網路日誌的中間人代理(man-in-the-middle proxy),這種方法揭示了推論端的變更,但無法暴露確切的伺服器端配置。

「分析的語料庫完全來自 Fable 5,在 xhigh 和 max 努力程度下,於一組多樣化的專案與工作負載的持續生產工作中取得。數據是從轉錄檔與即時網路日誌中彙整而來的。分析從這裡開始變得更糟……」 – @Aurornis (關於方法論的評論)


可能的解釋

  1. 成本驅動的運算節流 – 提供商可能會在初始發布窗口後減少每次請求的運算量,以管理營運支出。
  2. 刻意的 A/B 實驗 – 在使用者群體中輪換推論設定可以隱藏效能回歸,同時仍能提供標題級的基準分數。
  3. 與模型無關的降級 – 由於底層模型保持靜態,只有服務層發生變化,這意味著同一個模型在沒有任何權重更新的情況下可能會顯得更弱。
  4. 使用者工作負載漂移 – 隨著時間推移,開發人員可能會依賴模型執行更多常規任務,自然需要較少的推理 token。

法律與透明度影響

  • 潛在責任:如果提供商在沒有明確揭露的情況下刻意降低服務品質,使用者可能會主張違約或欺騙行為。
  • 對運算證明的呼籲:社群成員建議要求提供商為每次請求回傳類似校驗和(checksum)的量化水平或運算預算證明。

「所有 LLM API 提供商都應被強制要求回傳服務請求的模型量化水平的校驗和證明。基本的透明度應該是最低限度的要求。」 – @reilly3000


使用者現在可以做什麼

  • 記錄推論細節:記錄每次請求的 token 使用量、模型版本與努力程度,以偵測回歸。
  • 切換到自託管模型:像 Ollama 這樣的工具讓使用者可以在本地運行可比較的模型,避免不透明的服務變更。
  • 要求公開基準測試:鼓勵提供商發布定期、未經篩選的基準測試運行(例如每 2-3 天一次),以減少隱藏節流的誘因。

結論

Lon Lundgren 為期六週的深入研究提供了強有力的證據,證明 Fable 5 的推理能力是透過推論機制的變更而非改變模型本身而被系統性地降低。這種模式反映了社群對前沿 LLM 提供商普遍存在類似降級的報告,引發了對成本驅動的節流、透明度與使用者信任的擔憂。在提供商揭露推論配置或採用可驗證的運算證明機制之前,使用者將需要依賴獨立監控與自託管替代方案來保障效能。

Sources

相關