Claude Opus 4.5 發佈:頂尖的程式編寫、代理與生產力模型

TL;DR

Claude Opus 4.5 是 Anthropic 最新的旗艦模型,於今日在應用程式、API 及各大雲端平台同步推出。它在現實世界的軟體工程基準測試、長程自主任務以及日常生產力(試算表、簡報、研究)方面提供了最強大的性能,同時大幅降低了 Token 使用量,定價為每百萬 Token 5 至 25 美元。


什麼是 Claude Opus 4.5?

Claude Opus 4.5 是 Anthropic Opus 系列的最新迭代版本。該公司將其描述為 「智慧、高效,且是全球在程式編寫、代理(agents)與電腦使用方面最好的模型」。它的定位是預示 AI 如何增強工作的更大趨勢。

關鍵可用性詳情:

  • 模型識別碼:claude-opus-4-5-20251101
  • 可透過 Claude API、Anthropic 的消費級應用程式以及所有三大主流雲端平台進行存取。
  • 定價:基礎層級每百萬 Token 5 美元,高容量層級每百萬 Token 25 美元。

技術亮點

頂尖的軟體工程能力

  • SWE-bench Verified 基準測試中,Opus 4.5 在所有前沿模型中取得了最高分(參見 Anthropic 的圖表)。
  • 內部測試報告指出 「在降低一半 Token 使用量的同時,超越了內部程式編寫基準測試」「在所有基準測試中表現優於 Sonnet 4.5,且需要更少的步驟和更少的 Token。」
  • 特定的程式編寫優勢包括程式碼遷移、重構以及多代理協作(例如:由三個協作代理完成的兩個程式碼庫重構任務)。

長程自主推理

  • Opus 4.5 在處理複雜工作流程的 Terminal Bench 上,比 Sonnet 4.5 提升了 15%
  • 在 30 分鐘的自主程式編寫會話中,它產生的死路更少,且完成任務時的 工具調用(tool-calling)與建置/檢查(build/lint)錯誤減少了 50%–75%
  • 該模型擅長多步驟規劃,這體現在 τ2-bench 中對受限航空公司訂票場景提出的創意解決方案。

通用生產力提升

  • 視覺、推理與數學能力高於之前的 Opus 版本。
  • 跨多個領域(例如:Excel 自動化、財務建模、3D 視覺化)的基準測試顯示,準確度提升 20%效率提升 15%,且 Token 減少高達 65%
  • 長文本敘事:可以生成組織結構一致的 10–15 頁章節。

安全性改進

  • Anthropic 的系統卡(system card)聲稱 Opus 4.5 是他們發佈過 對齊(aligned)最穩健 的模型,且可能是目前整體對齊效果最好的前沿模型。
  • 根據使用極強注入攻擊的 Gray Swan 基準測試,其對提示詞注入(prompt-injection)的抵抗力強於任何競爭對手的前沿模型。
  • 「令人擔憂的行為」評分(衡量與濫用合作及自主發起的非預期行為)低於之前的版本。

新開發者平台功能

Effort(投入度)參數

  • 開發者可以在速度與能力之間進行權衡。在 medium 投入度下,Opus 4.5 的 SWE-bench 分數與 Sonnet 4.5 持平,但 減少了 76% 的輸出 Token。在 high 投入度下,它比 Sonnet 4.5 高出 4.3 個百分點,且 減少了 48% 的 Token

上下文壓縮與記憶工具

  • 內建的上下文編輯 SDK 可減少長對話的 Token 負擔。
  • 記憶工具可在對話輪次之間實現持久狀態,提升代理性能。

進階工具使用與子代理編排

  • Opus 4.5 可以管理子代理團隊,允許以極少的往返溝通進行複雜的多代理流水線作業。
  • 結合投入度控制與上下文管理,該模型在深度研究評估中實現了 ~15 個百分點的提升

利用 Opus 4.5 的產品更新

  • Claude Code:計畫模式(Plan Mode)現在會在執行前建立詳細且可由用戶編輯的 plan.md;桌面應用程式增加了並行本地/遠端會話,用於錯誤修復、研究與文件更新。
  • Claude app:自動摘要功能消除了對話長度限制,實現持續的長篇對話。
  • Claude for Chrome:對所有 Max 用戶開放,允許跨分頁自動化。
  • Claude for Excel:Beta 版已擴展至 Max、Team 與 Enterprise 用戶;利用了 Opus 4.5 優越的試算表推理能力。
  • 已取消 Max/Team Premium 用戶對 Opus 4.5 的使用限制,將 Token 限制調整至先前 Sonnet 的水平。

早期存取回饋(客戶引言)

“Opus 模型一直以來都是『真正的 SOTA』,但成本過高。Claude Opus 4.5 現在的價格水平使其可以成為您處理大多數任務的首選模型。” – Anthropic partner logo

“Claude Opus 4.5 提供高品質的程式碼,並在透過 GitHub Copilot 驅動重型代理工作流程方面表現出色。早期測試顯示,它在減少一半 Token 使用量的同時,超越了內部程式編寫基準測試。” – Customer testimonial

“Claude Opus 4.5 在我們的內部基準測試中擊敗了 Sonnet 4.5 和競爭對手,使用更少的 Token 來解決相同問題。” – Internal benchmark report

“Claude Opus 4.5 擅長長程自主任務,能以更少的死路處理複雜工作流程,並在 Terminal Bench 上提升了 15%。” – Evaluation summary

“我們看到使用 Claude Opus 4.5 時,工具調用錯誤與建置/檢查錯誤都減少了 50% 到 75%。” – Reliability testing


對 AI 領域的影響

  • 生產力前沿:透過以極小部分的 Token 成本提供頂尖的程式編寫性能,Opus 4.5 縮小了研究級模型與負擔得起的生產就緒型 AI 之間的差距。
  • 代理自主性:該模型設計創意解決方案的能力(例如:升等艙位的技巧)預示著向更靈活、目標導向型代理的轉變,這同時帶來了機會與對齊挑戰。
  • 安全性基準:更強的提示詞注入抵抗力為穩健性設定了新的行業基準,儘管 Anthropic 指出在減輕獎勵黑客(reward-hacking)行為方面仍有持續的工作。
  • 經濟影響:在嚴格的 2 小時居家工程考試中表現優於人類候選人,這預示著 AI 可能很快成為某些技術招聘流程中的具競爭力的替代方案。

欲了解更多資訊

  • Claude Opus 4.5 系統卡 – 詳細的能力與安全性評估方法論。
  • Claude API 文件 – 模型識別碼、定價與投入度控制使用方式。
  • Anthropic 研究頁面 – 探索先進 AI 更廣泛影響的社會影響與經濟未來計畫。

Sources

相關