Claude Opus 4.7 發佈說明 / 有什麼新功能

Anthropic 已宣布 Claude Opus 4.7 正式上市,這款模型旨在以更高的嚴謹性與一致性來處理複雜且長期的軟體工程任務。此次發佈重點在於提升編碼的自主性、透過更高解析度的視覺功能增強多模態能力,以及實施特定的網路安全防護措施。

進階軟體工程與代理能力

Claude Opus 4.7 在進階軟體工程方面較 Opus 4.6 有顯著提升,特別是在處理最困難的任務時。該模型旨在精準地處理複雜且長期的任務,更字面地遵循指令,並在回報結果前驗證自身的輸出。

早期存取測試者報告了代理工作流中的幾項關鍵改進:

  • 自主性與可靠性: 測試者注意到模型在規劃期間捕捉邏輯錯誤的能力,以及在進行深度調查工作時能持續協作數小時的能力。例如,Devin 報告稱 Opus 4.7 解鎖了一類先前無法可靠執行的深度調查工作。
  • 編碼基準測試: 在一個包含 93 項任務的編碼基準測試中,Opus 4.7 的解決率比 Opus 4.6 提升了 13%,解決了四項 Opus 4.6 與 Sonnet 4.6 都無法解決的任務。在 CursorBench 上,它達到了 70%,而 Opus 4.6 為 58%。
  • 工具使用與錯誤恢復: Notion Agent 報告稱其較 Opus 4.6 提升了 14%,且工具錯誤減少了三分之一,並指出模型具備在先前會導致模型停止運行的工具失敗中繼續執行的能力。
  • 生產環境任務解決率: 在 Rakuten-SWE-Bench 上,Opus 4.7 解決的生產環境任務是 Opus 4.6 的三倍,且在程式碼與測試品質方面有兩位數的增長。

增強的多模態支援與視覺功能

Opus 4.7 透過支援更高解析度的圖像,引入了大幅提升的視覺能力。該模型現在可以接受長邊最高達 2,576 像素(約 3.75 百萬像素)的圖像,解析度是先前 Claude 模型的三倍以上。

解析度的提升使得更精確的多模態使用案例成為可能,包括:

  • 為電腦使用代理(computer-use agents)閱讀密集的螢幕截圖。
  • 從複雜的技術圖表提取數據。
  • 為生命科學工作流解讀化學結構。

網路安全防護措施與網路驗證計畫

作為 Anthropic 在 Project Glasswing 之後策略的一部分,Opus 4.7 作為新的網路安全防護措施的測試場,在將其應用於 Claude Mythos Preview 等更強大的模型之前進行測試。雖然 Opus 4.7 的網路能力比 Mythos Preview 較弱——部分原因是為了進行差異化降低這些能力的訓練實驗——但它包含了能自動偵測並阻擋禁止或高風險網路安全請求的防護措施。

對於從事滲透測試、漏洞研究與紅隊演練等合法工作的安全專業人員,Anthropic 推出了 Cyber Verification Program 以提供受控存取。

技術規格與平台更新

定價與可用性

Claude Opus 4.7 可透過所有 Claude 產品、Claude API、Amazon Bedrock、Google Cloud Vertex AI 以及 Microsoft Foundry 使用。定價與 Opus 4.6 保持一致:

  • 輸入 Token: 每百萬個 $5
  • 輸出 Token: 每百萬個 $25

新功能與控制項

  • 努力程度(Effort Levels):highmax 之間引入了新的 xhigh(「額外高」)努力程度,讓使用者可以更好地在推理深度與延遲之間取得平衡。在 Claude Code 中,所有方案的預設努力程度現在皆為 xhigh
  • 任務預算(Task Budgets): 目前在 Claude API 上進行公開測試,任務預算允許開發者引導 Token 消耗,以便在長期任務中優先處理工作。
  • Claude Code 更新: 新的 /ultrareview 指令提供專用的審查會話,用以標記錯誤與設計問題。此外,「自動模式」(auto mode,一種減少干擾的權限選項)已擴展至 Max 使用者。

從 Opus 4.6 遷移至 Opus 4.7

雖然 Opus 4.7 是直接升級,但開發者應注意兩項影響 Token 使用量的主要變化:

  1. 更新的 Tokenizer: 更新後的 Tokenizer 改善了文本處理,但根據內容的不同,可能會使 Token 數量增加約 1.0–1.35×。
  2. 增加的推理能力: 在較高的努力程度下,模型會因為增加的思考過程而產生更多的輸出 Token,特別是在代理(agentic)設定下。

Anthropic 建議使用者重新調整提示詞(prompts)與框架(harnesses),因為 Opus 4.7 比以往的模型更字面地遵循指令,如果提示詞是針對較鬆散的解釋而編寫的,可能會導致非預期的結果。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch