Anthropic Claude Haiku 4.5 發佈:以三分之一的成本與兩倍的速度提供接近前沿等級的程式碼編寫效能

TL;DR

Claude Haiku 4.5 現已全面開放使用,其程式碼編寫效能可媲美前沿等級的 Claude Sonnet 4 模型,但成本僅約為其三分之一,且運行速度快了兩倍以上,非常適合低延遲、對成本敏感的應用程式。

在小型模型規模實現接近前沿的效能

Claude Haiku 4.5 的程式碼編寫品質可媲美 Claude Sonnet 4,而後者在五個月前仍是頂尖水準。在 Augment agentic coding 基準測試中,它達到了 90% 的 Sonnet 4.5 效能,甚至在特定任務(如 computer-use 互動)上超越了 Sonnet 4。這證明了小型模型現在可以在不犧牲品質與效率之間進行典型權衡的情況下,提供接近前沿等級的結果。

成本與速度優勢

  • 成本: 定價為每百萬個輸入 token 為 $1,每百萬個輸出 token 為 $5,大約是 Sonnet 4 成本的三分之一。
  • 速度: Haiku 4.5 的運行速度比 Sonnet 4.5 快 4–5 倍,能為聊天助手、客戶服務機器人以及配對程式設計工具提供即時回應。
  • 吞吐量: 該模型的效率擴展了在現有使用限制內可完成的工作量,從而實現更具響應性的 AI 輔助開發工作流。

對應用程式的實際影響

  • Claude for Chrome: 更快的推理速度使該瀏覽器擴充功能在即時協助方面變得更加實用。
  • Claude Code & Warp: 開發人員在進行程式碼迭代時,延遲明顯降低,特別是在多代理人 (multi-agent) 或快速原型設計場景中。
  • 代理人編排 (Agentic Orchestration): Sonnet 4.5 可以將複雜問題分解為多步驟計畫,並將子任務委派給多個 Haiku 4.5 實例,從而實現並行執行與更高的整體吞吐量。

基準測試亮點

  • SWE-bench Verified: Haiku 4.5 在以極低成本運行的同時,達到了與前沿模型相當的程式碼編寫效能。
  • 指令遵循 (slide text generation): 準確度為 65%,相對於 Anthropic 的頂級模型為 44%,顯示出強大的通用指令遵循能力。
  • GitHub Copilot 整合: 早期測試顯示其程式碼生成品質與 Sonnet 4 相當,但回應速度明顯更快。

"Claude Haiku 4.5 達到了一個我們認為不可能實現的平衡點:具備極速與成本效率,同時擁有接近前沿等級的程式碼編寫品質。" – Anthropic release statement

"Claude Haiku 4.5 是代理人編碼 (agentic coding) 的一大飛躍,特別是在子代理人編排與 computer-use 任務中。" – Anthropic release statement

安全性與對齊

  • 對齊 (Alignment): 自動化評估顯示,與 Claude Haiku 3.5、Sonnet 4.5 和 Opus 4.1 相比,其錯誤對齊行為的發生率在統計學上顯著降低,使 Haiku 4.5 成為 Anthropic 目前最安全的模型。
  • 風險概況: 有限的 CBRN 武器生產風險;被歸類為 AI Safety Level 2 (ASL-2),限制比 Sonnet 4.5 和 Opus 4.1 的 ASL-3 等級更少。
  • 系統卡片 (System Card): 完整的安全方法論與分類依據已記錄在 Claude Haiku 4.5 system card

可用性與整合

  • API Access: 開發人員可以透過 Claude API 使用識別碼 claude-haiku-4-5 來呼叫該模型。
  • 雲端平台: 該模型可在 Amazon Bedrock 與 Google Cloud Vertex AI 上使用,可作為 Haiku 3.5 與 Sonnet 4 的直接替換方案,且價格最為經濟。
  • Anthropic 產品: 已包含在 Claude Code、Claude for Chrome 以及其他 Anthropic 應用程式中。

未來方向

Claude Haiku 4.5 展現了模型向結合高推理能力與即時響應性的轉變。Anthropic 表示,這類模型將促成新的使用案例,例如大規模的子代理人編排與互動式 AI 助手,在這些領域延遲與成本先前曾是阻礙因素。

References

Sources

相關