Claude 2.1 發佈說明
Anthropic 已推出 Claude 2.1,這是一款專為企業應用設計的更新模型,具有顯著擴大的上下文窗口、提高的事實準確性以及新的整合能力。此版本專注於增強模型處理海量數據集的能力,並減少錯誤陳述的頻率,以提高商業營運的可靠性。
200K Token 上下文窗口
Claude 2.1 將其先前的容量翻倍至 200,000 token 的上下文窗口,這大約相當於 150,000 個單詞或超過 500 頁的文本。這種擴展允許用戶輸入整個代碼庫、財務報表(例如 S-1s)和長篇文學作品進行分析。
此窗口啟用的關鍵能力包括:
- 大規模摘要:處理並壓縮海量內容。
- 複雜問答:根據提供的廣泛數據回答問題。
- 趨勢預測:分析長期數據以預測模式。
- 文件比較:同時對比多份大型文件。
Anthropic 指出,處理 200K 長度的消息是業界首創,儘管完成通常需要數小時人工努力的任務可能需要幾分鐘時間。該公司預期隨著技術演進,延遲將會降低。
減少幻覺率
與 Claude 2.0 相比,Claude 2.1 在錯誤陳述方面展現了 2 倍的減少。這種「誠實度」的提升是透過使用一組精心挑選的複雜事實問題來衡量的,在這些問題中,模型被評估其是否具備承認不確定性(婉拒回答)而非提供錯誤主張的能力。
除了通用的誠實度之外,模型在理解和摘要複雜文件(如法律和財務報告)方面也展現了特定增益:
- 錯誤答案:減少了 30%。
- 錯誤主張:錯誤地得出文件支持特定主張的比例比先前版本低 3-4 倍。
API Tool Use (Beta)
Claude 2.1 引入了 tool use 作為 beta 功能,允許模型與外部 API、產品和開發者定義的函數進行整合。這使得 Claude 可以透過決定哪種工具是特定任務所需的,來代表用戶執行動作。
Tool use 應用的例子包括:
- 數值推理:使用計算機進行複雜數學運算。
- API 轉換:將自然語言請求轉換為結構化的 API 調用。
- 信息檢索:搜索數據庫或使用網絡搜索 API 來回答問題。
- 軟件自動化:透過私有 API 在軟件中執行簡單動作。
- 產品推薦:連接到數據集以協助用戶完成購買。
開發者體驗與系統提示詞
Anthropic 已透過引入 Workbench 更新了開發者體驗,這是一個遊樂場風格的環境,用於迭代提示詞並管理多個帶有已保存修訂版本的項目。開發者也可以生成代碼片段以將提示詞直接整合到 SDKs 中。
此外,此版本引入了 system prompts,這允許開發者提供自定義指令來定義 Claude 的個性、角色和響應結構,從而確保輸出更一致且更具可定制性,並符合特定用戶的需求。
可用性與定價
Claude 2.1 可透過 Anthropic Console 中的 API 使用,並為 claude.ai 的免費版和 Pro 版聊天體驗提供動力。200K token 上下文窗口專門為 Claude Pro 用戶保留。Anthropic 也更新了其定價以提高其模型跨不同模型的成本效率。
Sources
- OriginalIntroducing Claude 2.1
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch