Claude 3.7 Sonnet 與 Claude Code 發布
Anthropic 已宣布推出 Claude 3.7 Sonnet,這是首款混合推理模型,將標準 LLM 能力與擴展的逐步思考能力整合到單一模型中。此次發布引入了一種統一的推理方法,允許使用者在即時回應與深度反思之間進行選擇,以提升處理複雜技術任務的效能。
Claude 3.7 Sonnet: Hybrid Reasoning Capabilities
Claude 3.7 Sonnet 同時具備標準 LLM 與推理模型的功能。在標準模式下,它是 Claude 3.5 Sonnet 的升級版本。在擴展思考模式下,模型會在回答之前進行自我反思,這能增強其在數學、物理、程式碼編寫、以及指令遵循方面的表現。
推理系統的關鍵技術特性包括:
- Visible Thinking: 模型逐步推理的過程對使用者而言是可見的。
- Controllable Thinking Budgets: API 使用者可以指定思考預算(最高可達 128K tokens),讓他們能在回應速度與成本之間進行權衡,以換取更高的回答品質。
- Real-World Optimization: Anthropic 將重心從競賽風格的數學與電腦科學問題,轉向反映實際商業使用案例的現實世界任務。
Performance and Benchmarks
Claude 3.7 Sonnet 在兩項主要基準測試中達到了頂尖的效能:
- SWE-bench Verified: 評估模型解決現實世界軟體問題的能力。
- TAU-bench: 測試 AI agent 在涉及使用者與工具互動的複雜現實世界任務中的表現。
來自產業夥伴的早期測試顯示其在程式碼編寫方面具有極高的效能。Cursor 回報該模型在處理現實世界程式碼任務與複雜程式碼庫時表現為同類最佳。Cognition 指出其在程式碼變更與全端更新方面的規劃能力優於以往。Vercel 強調了其在複雜 agent 工作流中的精準度,而 Replit 使用該模型從零開始構建構建複雜的 Web App。Canva 回報其產出的程式碼已達到生產等級,且錯誤較少並具備卓越的設計品味。
Claude Code: Agentic Coding Tool
除了模型之外,Anthropic 也推出了 Claude Code,這是一款目前處於有限研究預覽階段的命令列工具。Claude Code 作為一個主動協作工具,可以:
- 搜尋並閱讀程式碼。
- 編輯檔案並執行測試。
- 將程式碼提交(commit)並推送到 GitHub。
- 使用命令列工具。
Anthropic 表示,在早期測試中,Claude Code 能在單次執行中完成以往需要超過 45 分鐘手動操作的任務。
Availability and Pricing
Claude 3.7 Sonnet 可於所有 Claude 方案(Free, Pro, Team, and Enterprise)、Claude Developer Platform、Amazon Bedrock 以及 Google Cloud 的 Vertex AI 上使用。除了免費方案外,擴展思考模式可在所有平台上提供。
定價與先前版本保持一致:
- Input tokens: $3 per million tokens.
- Output tokens: $15 per million tokens (including thinking tokens).
Safety and Reliability
與前代模型相比,Claude 3.7 Sonnet 將不必要的拒絕率降低了 45%,使其能更細緻地區分有害與良性的請求。此次發布也隨附了一份系統卡片(system card),詳細說明了負責任的擴展政策(Responsible Scaling Policy)評估,並解決了與電腦使用相關的風險,例如提示詞注入攻擊(prompt injection attacks)。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch