Claude 3.5 Sonnet 發佈說明 / 有什麼新功能
Anthropic 已推出 Claude 3.5 Sonnet,這是 Claude 3.5 模型家族的首個發佈版本。該模型在多項評估中展現出超越競爭對手模型以及先前頂級的 Claude 3 Opus 的智慧,同時保持了中階模型的速度與成本特性。
效能與智慧基準測試
Claude 3.5 Sonnet 在研究所等級的推理能力 (GPQA)、大學程度的知識 (MMLU) 以及程式碼編寫能力 (HumanEval) 方面,樹立了新的產業基準。該模型在掌握細微差別、幽默感以及遵循複雜指令方面展現出顯著進步,並能以自然的語氣產出高品質內容。
代理式程式碼編寫能力
在內部的代理式程式碼編寫評估中,Claude 3.5 Sonnet 解決了 64% 的問題,而 Claude 3 Opus 僅解決了 38%。這些測試衡量的是根據自然語言描述來修復錯誤或為開源程式碼庫增加功能的的能力。當配備相關工具時,該模型可以獨立撰寫、編輯並執行程式碼,從而促進程式碼轉換與舊版應用程式遷移等任務。
速度、成本與可用性
Claude 3.5 Sonnet 的運行速度是 Claude 3 Opus 的兩倍。這種效能提升與成本效益的結合,使其非常適合用於多步驟工作流與情境敏感型客戶支援。
價格與技術規格:
- 輸入成本: $3 每百萬個 token
- 輸出成本: $15 每百萬個 token
- 上下文窗口: 200K tokens
可用性:
- 免費使用: 可於 Claude.ai 與 Claude iOS app 使用。
- 付費使用: Claude Pro 與 Team 計畫訂閱者享有更高的速率限制。
- API/雲端使用: 可透過 Anthropic API、Amazon Bedrock 與 Google Cloud 的 Vertex AI 使用。
視覺推理與視覺能力
Claude 3.5 Sonnet 是 Anthropic 迄今最強大的視覺模型,在標準視覺基準測試中超越了 Claude 3 Opus。該模型在視覺推理方面展現出顯著進步,特別是在解讀圖表與圖形,以及從不完美的影像中準確轉錄文字的能力。這些能力特別適用於零售、物流與金融服務領域。
Artifacts:協作工作空間
Anthropic 在 Claude.ai 上推出了 "Artifacts" 功能,該功能將介面從對話式 AI 轉變為協作式工作環境。當 Claude 生成程式碼片段、網站設計或文字文件時,它們會出現在對話旁邊的專用視窗中。這讓使用者能夠即時查看、編輯並在 AI 生成的內容上進行建構。
安全、隱私與外部評估
根據紅隊測試評估,Claude 3.5 Sonnet 仍維持在 AI 安全等級 2 (ASL-2)。為了確保安全,Anthropic 與英國人工智慧安全研究所 (UK AISI) 合作,由其進行部署前的安全評估,並將結果與美國人工智慧安全研究所 (US AISI) 分享。
安全與隱私措施:
- 外部專家意見: Anthropic 整合了來自主題專家(包括 Thorn 的兒童安全專家)的意見,以改進分類器並微調模型。
- 數據隱私: 未經使用者明確許可,生成式模型不會使用使用者提交的數據進行訓練。
未來發展藍圖
Anthropic 計畫於今年晚些時候發佈 Claude 3.5 Haiku 與 Claude 3.5 Opus,以完善模型家族。未來的發展包括新的模態、企業應用整合,以及一項 "Memory" 功能,旨在讓 Claude 能夠記住使用者的偏好與互動歷史紀錄。
Sources
- OriginalIntroducing Claude 3.5 Sonnet
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch