Claude 3.7 Sonnet 延長思考模式發布

簡要重點

Anthropic 發布了 Claude 3.7 Sonnet,這款模型允許使用者切換「延長思考模式」,以增加處理複雜任務時的認知投入。此次發布的重要性在於引入了可見的原始思考過程與「行動擴展」功能,提升了模型在代理任務與複雜推理方面的表現。

延長思考與可見的思考過程

Claude 3.7 Sonnet 允許使用者透過啟用延長思考模式,讓模型對困難問題進行更深入的思考。這並非獨立的模型,而是同一模型分配更多時間與精力以得出答案。開發者亦可透過「思考預算」進一步控制此功能。

可見性的優勢

Anthropic 將原始思考過程對使用者公開,以達成以下目標:

  • 信任: 使用者可觀察並驗證得出答案所使用的推理步驟。
  • 對齊: 研究人員可識別內部思考與外部回應之間的矛盾,以檢測如欺騙等行為。
  • 洞見: 該過程揭示了類似數學與物理專家的推理模式,包括探索多個角度與反覆核對答案。

局限與風險

公開思考過程帶來特定挑戰:

  • 忠誠度: Anthropic 指出,思考過程中的英文詞彙可能無法完整反映模型的內部狀態,且模型經常根據未在思考中明確討論的因素做決策。
  • 角色與語氣: 由於標準角色訓練未應用於思考過程,內部推理較為冷靜且個人化程度較低,與最終輸出不同。
  • 安全性: 可見的思考可能被惡意使用者用來開發更有效的越獄策略,或誘導模型在訓練期間隱藏特定想法。

代理能力與行動擴展

Claude 3.7 Sonnet 引入「行動擴展」功能,提升模型迭代呼叫函數並回應環境變化的能,以完成開放式任務。

電腦使用與 OSWorld

模型可發出虛擬滑鼠點擊與鍵盤輸入以解決任務。在衡量多模態 AI 代理的 OSWorld 評估中,隨著模型獲得更多互動步驟,其表現與前代模型的差距持續擴大,顯示出更佳的長期任務執行能力。

Pokémon Red 基準測試

為測試代理能力,Anthropic 為 Claude 3.7 Sonnet 配備基本記憶與螢幕像素輸入,使其能遊玩《寶可夢 紅》。先前的 Sonnet 模型在早期即失敗(Claude 3.0 Sonnet 無法離開起始城鎮),而 Claude 3.7 Sonnet 成功挑戰三位道館館主並贏得徽章,透過質疑假設與嘗試多種策略實現。

推理時計算擴展

Claude 3.7 Sonnet 的表現會隨著推理階段(測試時)所使用的計算量而擴展。

串列擴展

模型使用「串列測試時計算」,即在輸出最終答案前執行一系列推理步驟。數學題目的準確率隨所採樣的思考 token 數量呈對數增長。

並行擴展

Anthropic 研究人員試驗了「並行測試時計算」,即採樣多個獨立的思考過程,並透過多數決或學習到的評分函數選出最佳結果。在 GPQA 評估(生物、化學與物理)中,此方法(使用 256 個獨立樣本與 64k token 的思考預算)達成 84.8% 的 GPQA 分數,其中物理子分數高達 96.5%。

安全與防護架構

AI 安全等級(ASL-2)

Anthropic 確認 Claude 3.7 Sonnet 符合 ASL-2 安全標準。儘管模型在協助參與者完成與化學、生物、輻射與核武器(CBRN)相關任務時出現某些「提升」,但所有嘗試均包含關鍵失敗,無法成功完成端到端流程。

思考過程防護

為防止有害內容外洩,Anthropic 對思考過程實施加密。若思考內容涉及高風險主題(例如網路攻擊或危險武器),使用者將看到訊息:「此回應的思考過程剩餘部分無法提供。」

提示注入防護

針對電腦使用功能,Anthropic 改進了對提示注入攻擊的防禦能力。透過結合新訓練、修正後的系統提示與專用分類器,模型現在能阻止此類攻擊 88% 的時間,較先前的 74% 有所提升。

Sources

相關