Claude Code 努力程度等級 A/B 測試與使用者回饋

Anthropic 在 Claude Code 中對努力程度映射進行 A/B 測試

Anthropic 正在針對 Claude Code(版本 2.1.236+)中數值努力程度如何映射到「effort」設定進行伺服器端 A/B 測試。在這些測試中,與「high」努力程度設定相關聯的數值可能會被映射到比先前版本更低的數字(例如,100 分中的 10 分),導致部分使用者察覺到模型效能或「智慧度」的下降。

技術實作與官方回應

Claude Code 團隊的 Thariq 已澄清,這些變更屬於伺服器端 API 服務配置。顯示或記錄的數值——例如在 high effort 設定下出現的「10」——是內部映射,並不一定代表實際努力程度的 0-100 量表。

根據 Claude Code 團隊的說法,就實際模型效能而言,使用者選擇的努力程度等級仍然保持不變。團隊表示,深入評估已確認這些映射變更不會影響模型效能。若使用者遇到明顯的退化情況,建議使用 /feedback 指令並附上其 session IDs 來回報問題。

使用者對模型效能的感知

儘管官方提供了保證,仍有數名使用者回報,新版模型的輸出品質有明顯下降,特別是提到「Fable」與「Opus 5」。

  • 任務執行效率低下: 一名使用者回報,先前在 4.6 版本中不到兩分鐘即可完成的簡單設定檔更新,在 Opus 5 上卻花了 43 分鐘,其中涉及了超出請求範圍的不必要沙盒與測試套件。
  • 離題與過度工程: 部分使用者觀察到,與舊版模型相比,Opus 5 與 Sonnet 5 在設定為「high」努力程度時,往往會產生未經要求的離題內容,特別是當設定為「high」時。
  • 模型退化: 部分使用者因察覺到 Fable 模型品質下降,已降級其訂閱方案或切換至其他替代模型(例如 Codex 或 GLM-5.3)。

社群對於 AI 動機與計費方式的討論

此事件引發了社群關於 LLM 提供商透明度的更廣泛討論。使用者對「enshitification」(產品變得對使用者越來越不實用以極大化利潤的過程)以及同樣不透明的 token-based 計費方式表示擔憂。

"Why are we allowing billing to take place in tokens that are nebulous and fully controlled by the operators who have no aligned incentives?"

批評者認為,基於 token 而非原始運算量或資源使用量的計費模式,讓提供商能夠在後端更改模型行為或路由,而使用者無法察覺,這可能導致以更高的成本換取較低品質的回答。

Sources

相關