Claude 3 模型系列發布
Anthropic 已宣布推出 Claude 3 模型系列,包含三個模型——Opus、Sonnet 與 Haiku——旨在提供智慧、速度與成本之間的可擴展平衡。此次發布標誌著通用智慧的重大進步,引入了多模態視覺能力,並減少了整個系列中不必要的拒絕行為。
Model Tiering and Capabilities
Claude 3 分為三個針對不同營運需求量身打造的模型:
- Claude 3 Opus: 系列中最智慧的模型,專為高度複雜的任務設計。它在包括 MMLU(大學程度專家知識)、GPQA(研究所程度專家推理)和 GSM8K(基礎數學)在內的基準測試中表現優於同儕。它適用於任務自動化、研發(R&D)以及進階策略分析。
- Claude 3 Sonnet: 定位於智慧與速度之間的平衡。它比 Claude 2 和 2.1 快 2 倍,並針對企業工作負載進行了優化,例如 RAG、銷售自動化和程式碼生成。
- Claude 3 Haiku: 最快且最具成本效益的模型。它專為即時客戶聊天、內容審核以及從非結構化數據中提取知識而設計,可提供近乎即時的響應。
Technical Advancements
Vision and Multimodality
所有 Claude 3 模型現在都具備精密的視覺能力,使其能夠處理包括照片、圖表、圖形和技術圖表在內的視覺格式。這種模態特別針對那些將知識庫儲存在 PDF、流程圖或簡報投影片中的企業用戶。
Accuracy and Hallucination Reduction
與 Claude 2.1 相比,Claude 3 Opus 在具挑戰性的開放式事實問題上展現了兩倍的準確度提升。該模型還展現了更低的錯誤答案(幻覺)水平,以及在不知道答案時更高頻率地承認不確定性。
Context Window and Recall
該系列以 200K 上下文窗口啟動,不過所有三個模型都可以為特定客戶接受超過 100 萬個 token 的輸入。在「Needle In A Haystack」(NIAH)評估中,Claude 3 Opus 在從龐大語料庫中召回資訊的準確度超過了 99%,偶爾還能識別出測試「針」是人為插入文本中的。
Instruction Following and Structured Output
Claude 3 模型在遵循複雜、多步驟指令和品牌語調指南方面展現了更好的依從性。它們在生成結構化輸出(例如 JSON)方面也更加熟練,這有助於自然語言分類和情緒分析。
Safety and Responsible Design
Anthropic 已實施多項安全措施以確保模型保持值得信賴:
- Refusal Rates: 模型與前代相比,對於接近系統護欄的無害提示詞的拒絕率顯著降低。
- Bias Reduction: 根據問答偏見基準測試(BBQ),Claude 3 展現出比前代模型更少的偏見。
- Safety Level: 根據 Anthropic 的負責任擴展政策(Responsible Scaling Policy),該系列仍維持在 AI 安全等級 2(ASL-2)。紅隊評估(Red teaming)結論指出,模型呈現的災難性風險潛力極小。
- Constitutional AI: 模型繼續利用 Constitutional AI 來提高透明度和安全性。
Pricing and Availability
| Model | Input (per M tokens) | Output (per M tokens) | Context Window |
|---|---|---|---|
| Opus | $15 | $75 | 200K* |
| Sonnet | $3 | $15 | 200K |
| Haiku | $0.25 | $1.25 | 200K |
*1M tokens 可供特定使用案例使用。
Availability: Opus 和 Sonnet 可透過 Claude API(通常在 159 個國家/地區可用)和 claude.ai(Sonnet 對免費用戶可用,Opus 對 Pro 訂閱者可用)使用。Sonnet 也可透過 Amazon Bedrock 使用,並在 Google Cloud 的 Vertex AI Model Garden 提供私人預覽,Opus 和 Haiku 也將很快跟進。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch