Anthropic Claude 3.5 Sonnet 與 Claude 3.5 Haiku 發佈
Anthropic 推出了升級版的 Claude 3.5 Sonnet 以及新模型 Claude 3.5 Haiku,同時為一項名為「computer use」的新功能推出了公開測試版。此更新使 AI 模型能夠像人類使用者一樣與電腦介面進行互動——移動游標、點擊按鈕以及輸入文字。
Computer Use:公開測試版中的通用電腦互動
Claude 3.5 Sonnet 是首個為「computer use」提供公開測試版的尖端 AI 模型,使其能夠將高階指令轉換為一系列電腦指令,以瀏覽軟體和網路。這項功能專注於通用電腦技能,而非依賴特定工具來執行個別任務。
技術實作與效能
開發者可以整合 API,讓 Claude 能感知並與電腦介面進行互動。在衡量人類般使用電腦能力的 OSWorld 評估中,Claude 3.5 Sonnet 在僅限截圖的類別中獲得了 14.9% 的分數,優於次佳的 AI 系統 7.8% 的分數。當被允許執行更多步驟以完成任務時,其分數提升至 22.0%。
目前的限制與安全性
Anthropic 將此功能描述為實驗性質,並指出其可能較為繁瑣且容易出錯。常見的人類動作如捲動、拖曳和縮放對該模型而言仍具挑戰性。為了降低與垃圾郵件、錯誤資訊和詐騙相關的風險,Anthropic 開發了新的分類器,用以識別何時啟用了 computer use 並判斷是否正在發生危害。
升級版 Claude 3.5 Sonnet:進階軟體工程
更新後的 Claude 3.5 Sonnet 與前代相比提供了全面的提升,在維持相同價格與速度的同時,顯著增強了其代理型編碼(agentic coding)與工具使用能力。
編碼與工具使用基準測試
- SWE-bench Verified: 效能從 33.4% 提升至 49.0%,超越了所有公開可用的模型,包括像 OpenAI o1-preview 這樣的推理模型。
- TAU-bench: 在零售領域,效能從 62.6% 提升至 69.2%;在航空領域,效能從 36.0% 提升至 46.0%。
行業採用
GitLab、Cognition 與 The Browser Company 等公司已報告了顯著的收益。GitLab 指出,在不增加延遲的情況下,推理能力增強了(在各種使用案例中最高達 10%),而 Cognition 則觀察到在編碼、規劃與問題解決方面的改進。
Claude 3.5 Haiku:速度與經濟實惠
Claude 3.5 Haiku 是 Anthropic 下一代速度最快的模型,專為低延遲與高效率而設計。它在許多智能基準測試中達到或超越了 Claude 3 Opus(前一代最大的模型)的效能,同時維持與原始 Claude 3 Haiku 相似的速度。
Claude 3.5 Haiku 在 SWE-bench Verified 上獲得了 40.6% 的分數,優於原始的 Claude 3.5 Sonnet 與 GPT-4o。由於其低延遲與改進的指令遵循能力,它針對面向使用者的產品、專業的子代理任務,以及處理大量數據(如庫存或定價記錄)進行了優化。
價格與供應情況
截至 2024 年 12 月 3 日,Claude 3.5 Haiku 的價格為每百萬輸入 token 0.80 美元,每百萬輸出 token 4.00 美元。它可透過 Anthropic API、Amazon Bedrock 與 Google Cloud 的 Vertex AI 使用,最初為純文字模型,隨後將支援影像輸入。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch