Claude 3 模型系列發布

Anthropic 已宣布推出 Claude 3 模型系列,包含三個模型——Opus、Sonnet 與 Haiku——旨在提供智慧、速度與成本之間的可擴展平衡。此次發布標誌著通用智慧的重大進步,引入了多模態視覺能力,並減少了整個系列中不必要的拒絕行為。

Model Tiering and Capabilities

Claude 3 分為三個針對不同營運需求量身打造的模型:

  • Claude 3 Opus: 系列中最智慧的模型,專為高度複雜的任務設計。它在包括 MMLU(大學程度專家知識)、GPQA(研究所程度專家推理)和 GSM8K(基礎數學)在內的基準測試中表現優於同儕。它適用於任務自動化、研發(R&D)以及進階策略分析。
  • Claude 3 Sonnet: 定位於智慧與速度之間的平衡。它比 Claude 2 和 2.1 快 2 倍,並針對企業工作負載進行了優化,例如 RAG、銷售自動化和程式碼生成。
  • Claude 3 Haiku: 最快且最具成本效益的模型。它專為即時客戶聊天、內容審核以及從非結構化數據中提取知識而設計,可提供近乎即時的響應。

Technical Advancements

Vision and Multimodality

所有 Claude 3 模型現在都具備精密的視覺能力,使其能夠處理包括照片、圖表、圖形和技術圖表在內的視覺格式。這種模態特別針對那些將知識庫儲存在 PDF、流程圖或簡報投影片中的企業用戶。

Accuracy and Hallucination Reduction

與 Claude 2.1 相比,Claude 3 Opus 在具挑戰性的開放式事實問題上展現了兩倍的準確度提升。該模型還展現了更低的錯誤答案(幻覺)水平,以及在不知道答案時更高頻率地承認不確定性。

Context Window and Recall

該系列以 200K 上下文窗口啟動,不過所有三個模型都可以為特定客戶接受超過 100 萬個 token 的輸入。在「Needle In A Haystack」(NIAH)評估中,Claude 3 Opus 在從龐大語料庫中召回資訊的準確度超過了 99%,偶爾還能識別出測試「針」是人為插入文本中的。

Instruction Following and Structured Output

Claude 3 模型在遵循複雜、多步驟指令和品牌語調指南方面展現了更好的依從性。它們在生成結構化輸出(例如 JSON)方面也更加熟練,這有助於自然語言分類和情緒分析。

Safety and Responsible Design

Anthropic 已實施多項安全措施以確保模型保持值得信賴:

  • Refusal Rates: 模型與前代相比,對於接近系統護欄的無害提示詞的拒絕率顯著降低。
  • Bias Reduction: 根據問答偏見基準測試(BBQ),Claude 3 展現出比前代模型更少的偏見。
  • Safety Level: 根據 Anthropic 的負責任擴展政策(Responsible Scaling Policy),該系列仍維持在 AI 安全等級 2(ASL-2)。紅隊評估(Red teaming)結論指出,模型呈現的災難性風險潛力極小。
  • Constitutional AI: 模型繼續利用 Constitutional AI 來提高透明度和安全性。

Pricing and Availability

Model Input (per M tokens) Output (per M tokens) Context Window
Opus $15 $75 200K*
Sonnet $3 $15 200K
Haiku $0.25 $1.25 200K

*1M tokens 可供特定使用案例使用。

Availability: Opus 和 Sonnet 可透過 Claude API(通常在 159 個國家/地區可用)和 claude.ai(Sonnet 對免費用戶可用,Opus 對 Pro 訂閱者可用)使用。Sonnet 也可透過 Amazon Bedrock 使用,並在 Google Cloud 的 Vertex AI Model Garden 提供私人預覽,Opus 和 Haiku 也將很快跟進。

Sources

相關