Claude 4 發佈說明 / 有什麼新功能

Anthropic 推出了下一代 Claude 模型,Claude Opus 4Claude Sonnet 4。這些模型為程式碼編寫、進階推理與 AI agent 設定了新的基準,並引入了混合模式,讓使用者可以在近乎即時的回答與用於深度推理的延伸思考之間進行切換。

模型性能與基準測試

Claude Opus 4 與 Claude Sonnet 4 在軟體工程與推理任務中領先業界。Opus 4 被定位為全球最佳的程式碼編寫模型,而 Sonnet 4 則在性能與效率之間取得了平衡。

程式碼編寫與軟體工程

  • SWE-bench: Claude Opus 4 達成了 72.5% 與 Claude Sonnet 4 達成了 72.7% 的 pass@1。
  • Terminal-bench: Claude Opus 4 以 43.2% 領先,顯著優於其他模型。
  • Agentic Terminal Coding: 當使用 Claude Code 作為 agent 框架時,Opus 4 達到 43.2%,而 Sonnet 4 達到 35.5%。

推理與知識

  • GPQA Diamond: Opus 4 獲得 79.6%(在使用平行測試時推理時,得分為 83.3%)。
  • AIME 2025: Opus 4 達成了 75.5%(在使用平行測試時推理時,增加至 90.0%)。
  • MMMLU: Opus 4 獲得 88.8%,而 Sonnet 4 獲得 86.5%。
  • MMMU (Validation): Opus 4 獲得 76.5%,而 Sonnet 4 獲得 74.4%。

關鍵技術能力

Claude 4 引入了幾項旨在增強 AI agent 自主性與可靠性的架構與功能改進。

延伸思考與工具使用

兩個模型現在都支援延伸思考與工具使用 (beta)。這讓模型可以在內部推理與執行工具(例如網路搜尋)之間交替進行,以精煉其回答。此外,模型現在可以平行地執行工具。

記憶與連續性

Claude Opus 4 展示了顯著提升的記憶能力。當開發者授予其存取本地檔案的權限時,該模型可以建立並維護「記憶檔案」以提取並儲存關鍵事實。這讓模型能夠建立隱性知識並在長期任務中保持連續性。

可靠性與精準度

Anthropic 降低了模型使用捷徑或漏洞來完成任務的傾向。與 Sonnet 3.7 相比,Opus 4 與 Sonnet 4 在執行 agent 任務時,產生此類行為的機率降低了 65%。

思考摘要

為了管理冗長的思考過程,Claude 4 模型使用較小的模型來濃縮思考摘要。這應用於大約 5% 的案例中,即思考過程過長而無法完整顯示時。

Claude Code 與開發者生態系統

Claude Code 現在已全面開放使用,擴展了開發者在終端機與 IDE 中與 AI 協作的能力。

  • IDE 集成: VS Code 與 JetBrains 的新 beta 擴充功能讓建議的修改內容可以直接在檔案內行顯示。
  • Claude Code SDK: 一個可擴展的 SDK 讓開發者可以建立自定義 agent。
  • GitHub 集成: 一個 beta 集成讓 Claude Code 可以回應 PR 反饋、修復 CI 錯誤,並透過標記 (tagging) 來修改程式碼。
  • API Enhancements: 發佈了四項新 API 能力:程式碼執行工具、MCP connector、Files API,以及長達一小時的 prompt 緩存。

業界採用與反饋

幾家頂尖 AI 公司與平台已整合了 Claude 4:

  • GitHub: 將引入 Claude Sonnet 4 作為 GitHub Copilot 中新開發的 coding agent 的核心模型。
  • Cursor: 將 Opus 4 描述為在複雜程式碼庫理解方面的重大飛躍。
  • Replit: 報告稱在處理跨多個檔案的複雜變更時,精準度有所提升。
  • Block: 指出 Opus 4 是其 agent codename goose 中,第一個在編輯與除錯期間提升程式碼品質的模型。
  • Rakuten: 驗證了 Opus 4 能獨立運行開源重構任務長達 7 小時。
  • Cognition: 表示 Opus 4 在解決先前模型無法處理的複雜挑戰時表現卓越。

可用性與定價

Claude Opus 4 與 Sonnet 4 可透過 Claude.ai 介面、Amazon Bedrock 與 Google Cloud Vertex AI 使用。

  • 定價:
    • Opus 4: 每百萬 input tokens 為 $15 / 每百萬 output tokens 為 $75。
    • Sonnet 4: 每百萬 input tokens 為 $3 / 每百萬 output tokens 為 $15。
  • 存取方式: Pro, Max, Team, 與 Enterprise 計畫包含兩款模型。Sonnet 4 也提供給免費使用者使用。

Sources

相關