Anthropic Fable Guardrails Face Backlash from Cybersecurity Researchers
Overly Restrictive Guardrails Impede Legitimate Research
Anthropic 的 Fable 模型(Mythos 模型的公開版本)正因其頻繁阻擋非惡意請求的護欄(guardrails)而面臨來自安全社群的重大批評。研究人員報告稱,該模型會拒絕僅與網路安全或生物學有間接關係的任務,通常是因簡單的關鍵字而非意圖而觸發。
安全專業人士舉出了幾個過度阻擋的例子:
- Innocuous Reading: Valentina ‘Chompie’ Palmiotti 來自 IBM X-Force,她指出 Fable 會拒絕像閱讀部落格文章這類簡單的請求,只要該文章被認為與網路安全相關。
- Secure Coding: Matt Suiche 來自 Tolmo,他觀察到要求模型寫出安全代碼(secure code)通常會觸發降級,因為模型會將該請求解釋為網路安全工作,而非軟體工程的最佳實踐。
- General Code Review: 研究人員報告稱,即使是基本的代碼審查(code review)請求也會被標記。
- Non-Cyber Tasks: 用戶報告稱模型會將基本的生物學問題(例如在照片中識別真菌或詢問關於粒線體)標記為潛在的生物武器開發。
Model Degradation and the "Fallback" Mechanism
當 Fable 的安全措施被觸發時,系統不僅僅是拒絕提示詞(prompt),它還會暫停對話並自動將用戶切換到 Claude Opus 4.8。這種機制被用戶描述為能力上的「降級」。
批評者認為這種做法會造成誤導性的用戶體驗。一位用戶指出,模型可能會在沒有立即說明清楚的情況下,透過切換到性能較低的模型來「破壞」研究,儘管 Anthropic 確實會說明切換發生是因為網路安全或生物學原因。這種回退(fallback)行為對那些已申請 Cyber Verification Program (CVP) 的人來說特別令人沮喪,因為一些用戶報告稱,即使在獲得特定任務(例如 Android kernel development)的豁免權後,限制仍然存在。
The Tension Between Safety and Utility
Anthropic 維持其觀點,認為這些限制是為了防止惡意軟體或生物武器的開發。該公司先前透過 Project Glasswing 將功能更強大的 Mythos 模型限制在少數組織中使用,以保護關鍵基礎設施。
然而,社群反應顯示安全目標與實際效用之間的錯位:
"So a determined attacker rewrites the prompt and gets through, and the IBM X-Force researcher trying to read a blog post gets blocked. Working as intended, apparently."
一些專家建議,護欄(guardrails)過於生硬,依賴於詞彙領域和關鍵字(例如 "genetics" 或 "buffer overflow")而非對提示詞上下文的細微理解。這導致了擔憂,即護欄僅起到了「減速帶」的效果,阻礙了合法的專業人士,卻無法阻止決心十足的惡意攻擊者。
Industry Response and Policy Shifts
為了回應廣泛的譴責,Anthropic 已開始收回部分政策。根據 Wired 的報導,Anthropic 表示:「我們正在更改 Fable 5 的前沿 LLM 開發護欄,使其變得可見。我們做出了錯誤的權衡,我們為未能取得平衡而道歉。」
儘管如此,用戶仍持續報告模型在專業領域(如逆向工程、隱私工具和有機化學)中的效用問題,聲稱該模型在目前狀態下對於這些專業應用實際上是無法使用的。