Claude Opus 5.5 性能與智慧分析

Claude Opus 5.5 的智慧與能力

Claude Opus 5.5 在原始智慧方面被定位為領先模型,特別是在代理型知識工作與專業推理方面。根據 Artificial Analysis Intelligence Index v4.3.2,該模型在十項不同基準上進行評估,包括 AA-Briefcase v1.1、AutomationBench-AA 和 Terminal-Bench 4.0。

關鍵智慧基準

  • 代理型工作流程: 模型在代理型知識工作、現實世界工作任務、SaaS 工作流程以及程式碼/終端使用方面接受測試。
  • 知識可靠性: AA-Omniscience Index 衡量模型提供正確答案的能力,同時懲罰幻覺,分數範圍為 -100 到 100。
  • 專業推理: 評估項目包括醫療長上下文推理與專業文件推理(全部通過)。

成本與效率分析

Claude Opus 5.5 在高努力設定下,與其前代產品 Opus 5 相比,顯著提升了成本效率。

每項任務成本

一位使用者指出,在比較高努力設定時,Opus 5.5 的每項任務成本約為 Opus 5 的一半。此效率以每 Intelligence Index 任務的加權平均成本來衡量,包含輸入、快取命中、快取寫入、推理與答案的 token 價格。

Token 使用與定價

  • 上下文視窗: 該模型支援大型上下文視窗,以促進 RAG(檢索增強生成)工作流程。
  • 定價結構: 定價包含快取提示(快取命中)的特定费率,相比一般輸入價格提供折扣。

推理設定:中、高與最大

Claude Opus 5.5 提供不同推理努力設定——中、高與最大,每種設定都會影響性能與 token 消耗。

性能權衡

  • 中(預設): 使用者報告此設定在緊湊與長時間執行的迴圈中均表現良好。
  • 高: 一些使用者認為這是性能的「黃金點」,指出基準測試通常在此設定後便達到平台期,且在初步測試中表現出色。
  • 最大: 「最大」推理設定可能容易出現「過度思考」。一位使用者報告,模型在仍對簡單的 SVG 生成任務進行推理時,已耗盡其 128,000 token 預算,未能產生回應。

使用者反饋與比較洞察

社群討論突顯了對穩定性與價值的混合評價,以及對改進的期待。

相較於 Opus 5 的改進

使用者指出,Opus 5.5 的輸出風格與冗長程度相比 Opus 5 有顯著提升,部分人預測 Opus 5 的使用量將迅速下降。

穩定性與指令遵循

部分使用者對 Opus 5 表示不滿,指出其容易迷失方向或偏離主題,與 Opus 4.8 的穩定性相比顯得不足。大家希望 Opus 5.5 能解決這些指令遵循問題。

競爭格局

  • 開源權重 vs. 專有模型: 對專有模型的價值主張存在持續爭議。有人認為基礎模型僅略優於開源權重替代方案,但成本卻高得多。
  • 模型比較: 使用者將「頂級」模型歸類為 GPT-6、Opus 5/Fable 和 Grok,其中 Claude 因規劃與執行能力受到讚譽,而 GPT-6 與 Codex 則被認為在除錯方面更優。

"科技的歷史充滿了‘足夠好’每天吃掉‘最好’的案例。除非大型實驗室能迅速提出可行的商業計畫,否則 AI 似乎也不會例外。"

"我兩次嘗試使用最大設定執行『產生一隻鸛鳥騎自行車的 SVG』都失敗了,因為在兩次情況下,模型在仍在思考問題時就耗盡了 128,000 token 的預算。"

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch