Anthropic 改進 Claude Fable 5 生物學安全防護措施
Anthropic 已更新 Claude Fable 5 的生物學安全防護措施,在其產品介面上將生物學相關的「回退」(fallbacks)——即系統將查詢重新路由至能力較低的模型——減少了約 85%。此次更新允許 Fable 5 協助處理更廣泛的良性生物學任務,包括教育查詢和日常健康問題,同時繼續限制高風險的雙用途能力。
擴大對良性生物學任務的存取權限
Fable 5 現在可以處理更廣泛的生物學相關請求,且誤報率顯著降低。使用者在執行以下任務時將減少干擾:
- 日常健康與教育: 解讀實驗室結果、理解症狀,以及在教育背景下學習生物學。
- 臨床支援: 醫療保健專業人員現在可以從 Fable 5 獲得更多臨床任務的支援。
儘管有了這些改進,Fable 5 仍會將涉及病毒學、毒理學和分子設計的請求路由至 Opus 5。這些領域被歸類為雙用途,目前尚不適用於專業生物學研究或藥物開發。
雙用途生物學能力的風險
Anthropic 維持嚴格的安全防護措施,因為 Fable 5 的生物學能力在某些複雜任務上可能超越專家,從而為惡意行為者創造了「提升」(uplift)風險。主要的挑戰在於生物學研究的「雙用途」性質,即用於益處目的的相同技術也可能被重新用於造成傷害。
- 意圖的模糊性: 研究治療方法通常需要產生危險化合物。例如,製造活疫苗需要培養疫苗旨在預防的相同病原體,而研發高血壓藥物 captopril 需要分離蛇毒中的毒性成分。
- 外部威脅: Anthropic 引用了美國情報界 2026 年年度威脅評估,其中指出合成生物學和基因組編輯的進步可能會導致新型生物威脅,特別是來自擁有攻擊性生物和化學武器計畫的國家行為者。
由於存在災難性誤用的潛力,Fable 5 最初推出時幾乎封鎖了所有的生物學查詢,以確保在其他領域的通用可用性,同時精煉製製作安全防護措施。
生物學安全防護措施的技術實施
Anthropic 利用安全分類器(safety classifiers)——較小的自動化 AI 系統——來檢測何時 Fable 5 被要求執行受保護的任務或產生有害輸出。
回退機制
當安全分類器被觸發時,系統不會簡單地封鎖請求;相反,它會將使用者的查詢重新路由至 Opus 5。Opus 5 是一個能力強大的模型,但缺乏 Fable 5 的高階生物學能力,從而限制了惡意使用者可以獲得的協助。 }
精煉分類器
為了在不增加偽陰性(漏掉有害內容)的情況下減少誤報,Anthropic 實施了以下更新:
- 憲法重寫: 團隊重寫了分類器的「憲法」(用於區分受保護內容與允許內容的規則集),以更詳細地定義良性用途。
- 專家諮詢: Anthropic 向來自內部和外部的多元專家群體徵求了關於這些變化的反饋。
- 重新訓練: 分類器使用基於新憲法更新的訓練數據進行了重新訓練,並驗證了其仍能針對有害和雙用途研究觸發,同時允許更多良性內容。
Anthropic 承認,在「安全邊際」內仍會存在一些誤報,即出於極度謹慎的考慮,低風險的請求仍會被封鎖。該公司仍致力於為專業研究人員開發值得信賴的存取路徑,以便安全地使用前沿生物學能力。
Sources
- OriginalImproving Fable 5 Safeguards
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch