Anthropic 改進 Claude Fable 5 生物學安全防護措施

Anthropic 已更新 Claude Fable 5 的生物學安全防護措施,在其產品介面上將生物學相關的「回退」(fallbacks)——即系統將查詢重新路由至能力較低的模型——減少了約 85%。此次更新允許 Fable 5 協助處理更廣泛的良性生物學任務,包括教育查詢和日常健康問題,同時繼續限制高風險的雙用途能力。

擴大對良性生物學任務的存取權限

Fable 5 現在可以處理更廣泛的生物學相關請求,且誤報率顯著降低。使用者在執行以下任務時將減少干擾:

  • 日常健康與教育: 解讀實驗室結果、理解症狀,以及在教育背景下學習生物學。
  • 臨床支援: 醫療保健專業人員現在可以從 Fable 5 獲得更多臨床任務的支援。

儘管有了這些改進,Fable 5 仍會將涉及病毒學、毒理學和分子設計的請求路由至 Opus 5。這些領域被歸類為雙用途,目前尚不適用於專業生物學研究或藥物開發。

雙用途生物學能力的風險

Anthropic 維持嚴格的安全防護措施,因為 Fable 5 的生物學能力在某些複雜任務上可能超越專家,從而為惡意行為者創造了「提升」(uplift)風險。主要的挑戰在於生物學研究的「雙用途」性質,即用於益處目的的相同技術也可能被重新用於造成傷害。

  • 意圖的模糊性: 研究治療方法通常需要產生危險化合物。例如,製造活疫苗需要培養疫苗旨在預防的相同病原體,而研發高血壓藥物 captopril 需要分離蛇毒中的毒性成分。
  • 外部威脅: Anthropic 引用了美國情報界 2026 年年度威脅評估,其中指出合成生物學和基因組編輯的進步可能會導致新型生物威脅,特別是來自擁有攻擊性生物和化學武器計畫的國家行為者。

由於存在災難性誤用的潛力,Fable 5 最初推出時幾乎封鎖了所有的生物學查詢,以確保在其他領域的通用可用性,同時精煉製製作安全防護措施。

生物學安全防護措施的技術實施

Anthropic 利用安全分類器(safety classifiers)——較小的自動化 AI 系統——來檢測何時 Fable 5 被要求執行受保護的任務或產生有害輸出。

回退機制

當安全分類器被觸發時,系統不會簡單地封鎖請求;相反,它會將使用者的查詢重新路由至 Opus 5。Opus 5 是一個能力強大的模型,但缺乏 Fable 5 的高階生物學能力,從而限制了惡意使用者可以獲得的協助。 }

精煉分類器

為了在不增加偽陰性(漏掉有害內容)的情況下減少誤報,Anthropic 實施了以下更新:

  1. 憲法重寫: 團隊重寫了分類器的「憲法」(用於區分受保護內容與允許內容的規則集),以更詳細地定義良性用途。
  2. 專家諮詢: Anthropic 向來自內部和外部的多元專家群體徵求了關於這些變化的反饋。
  3. 重新訓練: 分類器使用基於新憲法更新的訓練數據進行了重新訓練,並驗證了其仍能針對有害和雙用途研究觸發,同時允許更多良性內容。

Anthropic 承認,在「安全邊際」內仍會存在一些誤報,即出於極度謹慎的考慮,低風險的請求仍會被封鎖。該公司仍致力於為專業研究人員開發值得信賴的存取路徑,以便安全地使用前沿生物學能力。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch