Opus 5 在 Artificial Analysis Intelligence 排行榜上排名第一
Opus 5 在 Artificial Analysis Intelligence 排行榜上排名第一
Opus 5 領導 Intelligence 排行榜
Opus 5 在 Artificial Analysis Intelligence 排行榜上佔據首位。 Hacker News 貼文指出 Opus 5 目前在排行榜上排名 #1。 @didibus 的評論列出領先模型:Claude Opus 5 (自適應推理, 最大努力) 得分 61,Claude Opus 5 (自適應推理, 極高努力) 得分 60,Claude Fable 5 (自適應推理, 最大努力, Opus 4.8 後備) 得分 60,GPT‑5.6 Sol (max) 得分 59,以及 Claude Opus 5 (自適應推理, 高努力) 得分 59。
Intelligence 指數衡量什麼
Artificial Analysis Intelligence Index v4.1 結合九項具體評估以產生單一分數。 該指數包含 GDPval‑AA v2、𝜏³‑Banking、Terminal‑Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA‑Omniscience 和 AA‑LCR。 推理模型在顯示中用燈泡圖示標記。 方法論頁面解釋每項評估如何執行和加權。
成本與效能權衡
Opus 5 提供最高智能,但成本高昂,且有幾個更便宜的模型提供幾乎相同的分數。 @chmod775 指出 Opus 5 是 Fable 5 之後第二昂貴的模型,且至少有兩個模型(GPT‑5.6 和 Kimi K3)在大約半數成本下,其得分與 Opus 5 的差距僅在 1‑2% 以內。 @nu11ptr 觀察到 GPT‑5.6 Sol Max 大約僅需 Opus 5 一半的成本,即可獲得幾乎相同的效能。 @zkmon 建議更有用的指標應該是每美元的智能,而 @XCSme 將權衡描述為 "成本加倍才能獲得多 4% 的智能)。
社群對可靠性與易用性的反應
用戶報告經驗參差不齊,提及可靠性問題、UI 問題以及偶爾的過度設計。 @andy99 認為可靠性比小幅分數差異更重要,並將 Claude(包括 Opus 5)描述為受到保護機制影響,導致輸出被拒絕或降級。 @theplumber 認為 Opus 5 「更笨」或「更膚淺」比 Opus 4.8,表示它在一次會話中迷失了。 @hoppp 說編碼風格與 Fable 不同,且該模型過度構建了所請求的解決方案。 @zuzululu 報告使用數小時後,Opus 5 的表現與 GPT‑5.6 沒有明顯優劣之分,批評其 UI 出乎意料地差,並指出與 Sol 5.6 相比缺乏深度。 @claude-ai 認為 Opus 5 的感覺就像 Haiku 級別,相較於 Opus 4.8(良好)和 Fable(卓越),在權限提示時會感到困惑,且無法調試它自己導致失敗的測試,而 Opus 4.8 則在無需大量 "思考) 的情況下解決了問題。 @sggyamg 簡單地稱該模型為「新穎、正常」。
技術規格:上下文視窗、速度、延遲、模型大小
Opus 5 的技術特性包括一個定義好的上下文視窗、每秒 token 數速度、延遲指標以及參數數量。 上下文視窗章節顯示合併輸入和輸出 token 的最大數量;數值越高對檢索增強工作流程越有利。 輸出速度衡量模型每秒生成的 token 數;數值越高越好。 延遲(首個答案 token 的時間)報告接收第一個答案 token 所需的秒數,包括推理模型的任何「思考」時間。 端到端響應時間給出輸出 500 個 token 所需的秒數,結合輸入時間、思考時間(適用於推理模型)以及基於輸出速度的回答時間。 模型大小(適用於開放權重模型)區分可訓練參數總數與推理期間執行的活躍參數;對於密集模型,活躍參數等於總參數,而專家混合模型則將工作路由到專家子集。 推理模型在這些章節中以燈泡圖示標示。
開放性與推理指標
開放性指數量化模型的開放程度,而 AA‑Omniscience 指數衡量知識可靠性與幻覺。 開放性指數是一個 0 到 100 的標準化分數,分數越高表示開放程度越高。 AA‑Omniscience 指數(分數越高越好)會獎勵正確答案,懲罰幻覺,且對拒絕回答不施加懲罰;分數範圍為 ‑100 到 100,其中 0 表示正確和錯誤答案數量相等。 兩項指標都對推理模型使用燈泡圖示。