Claude 2 發佈說明

Anthropic 已宣布發佈 Claude 2,這是一款新模型,在推理、編碼和安全性方面有顯著改進,並大幅擴展了上下文窗口。此次更新使模型能夠處理數百頁的技術文檔,並在單次輸出中生成更長的文檔。

擴展的上下文與輸出能力

Claude 2 支持每條提示詞高達 100K tokens 的輸入容量。這種擴展的上下文窗口允許模型在單次交互中分析廣泛的數據集,例如整本書或全面的技術文檔。此外,模型現在可以生成更長的輸出,包括跨越數千 tokens 的故事、信件和備忘錄。

性能基準測試與技術改進

與其前身 Claude 1.3 相比,Claude 2 在推理、數學和編碼方面展現了可衡量的改進:

  • 法律推理: Claude 2 在律師考試的多選題部分得分為 76.5%,高於之前的 73.0%。
  • 編碼: 在 Codex HumanEval Python 編碼測試中,Claude 2 得分為 71.2%,高於之前的 56.0%。
  • 數學: 在 GSM8k 小學數學問題集中,該模型的得分為 88.0%,而 Claude 1.3 為 85.2%。
  • 學術測試: 與研究生申請者相比,Claude 2 在 GRE 閱讀和寫作考試中得分超過第 90 百分位數,並在定量推理方面表現出與中位數申請者相似的水平。

安全性與無害性

Anthropic 已實施迭代的安全性改進,使 Claude 2 對於攻擊性或危險輸出的抵抗力更強。根據使用自動化測試和對代表性有害提示詞集進行手動檢查的內部紅隊評估,Claude 2 提供無害回應的能力比 Claude 1.3 高出 2 倍。這些改進是廣泛的紅隊演練和旨在降低越獄可能性之特定安全技術的結果。

可用性與集成

Claude 2 可通過 API 向企業提供,價格與 Claude 1.3 相同。它也為 claude.ai 提供面向公眾的測試版聊天體驗,目前對美國和英國的用戶開放。

企業合作夥伴

兩家關鍵合作夥伴已將 Claude 2 集成到其平台中:

  • Jasper: 該生成式 AI 平台利用 Claude 2 進行長篇、低延遲的使用案例,利用大 3 倍的上下文窗口來重新混合現有內容並提高複雜提示詞的推理能力。
  • Sourcegraph: 編碼助手 Cody 使用 Claude 2 通過 100K 上下文窗口傳遞更多代碼庫上下文,從而提供更準確的答案。Cody 還受益於 Claude 2 在更近期數據上的訓練,從而獲得對新框架和庫的知識。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch