Anthropic 恢復 Claude Fable 5 與 Mythos 5 的存取權

簡要重點

Anthropic 在美國出口管制解除後,已恢復全球對 Claude Fable 5 與 Claude Mythos 5 的存取權,並引入更嚴格的安全分類器、提出業界通用的越獄嚴重程度框架,以及與美國政府展開更深入的合作。


即時可用性與使用條款

  • Claude Fable 5 於 7 月 1 日起在 Claude Platform、Claude.ai、Claude Code 與 Claude Cowork 上可用。對於 Pro、Max、Team 及部分企業方案,該模型在 7 月 7 日前可計入每周使用上限的最多 50 %;之後則需透過使用信用額度存取。
  • Claude Mythos 5 在 6 月 26 日獲得政府批准後,已恢復對一組美國組織的存取權。主要雲端供應商(AWS、Google Cloud、Microsoft Foundry)的存取權將盡快重新啟用。
  • 兩個模型共享相同的基礎架構;Fable 5 上線時配備最強的防護機制,而 Mythos 5 最初僅限於信任的 Project Glasswing 合作夥伴,用於防禦性資安工作。

事件時間軸與安全防護增強

日期 事件
6 月 9 日 發布 Claude Fable 5 與 Claude Mythos 5。
6 月 12 日 美國政府因 Amazon 報告的繞過行為實施出口管制,該行為讓 Fable 5 能枚舉軟體漏洞,甚至在一個案例中產生攻擊程式碼。
6 月 12 日–30 日 Anthropic 與政府及合作夥伴合作,審查報告、測試其他模型,並開發新的安全分類器。
6 月 30 日 出口管制解除(來源:Howard Lutnick 在 X 上的發文)。
7 月 1 日 Fable 5 全球重新部署;Mythos 5 在美國有限度重新部署。

關鍵安全更新:新的安全分類器在超過 99 % 的情況下可阻擋 Amazon 報告中描述的特定技術。當請求被阻擋時,使用者會收到通知,並自動將查詢轉送至 Opus 4.8。此分類器會增加對良性程式設計/除錯任務的誤判率,但 Anthropic 接受此代價,以維持較大的安全邊際。


Anthropic 的資安防護策略

  • 深度防禦:多層防護機制——模型層級的拒絕訓練、事後濫用分析與專用分類器——共同防止危險行為。
  • 安全分類器:小型 AI 系統,用於標記可能涉及有害資安行為的請求。Fable 5 的安全邊際刻意寬鬆,導致部分良性請求被阻擋,以確保真正危險的請求幾乎不會被漏掉。
  • 分類器行為圖示(節錄):
    • 第 A 行 – 基線分類器行為。
    • 第 B 行 – Fable 5 的擴展安全邊際,阻擋更多良性請求,但減少漏掉有害案例的機率。
    • 第 C–E 行 – 展示微小、狹窄與普遍性越獄如何與安全邊際互動。
  • 越獄韌性:微小越獄可能逃過分類器,但仍處於安全邊際內,限制潛在損害。狹窄有害越獄較少見;截至撰寫時,尚未觀察到 Fable 5 的普遍性越獄。
  • 持續優化:Anthropic 將持續調整分類器,以減少誤判,同時維持對主動資安能力的強大防護。

提出的業界 AI 越獄嚴重程度框架

Anthropic 與 Amazon、Microsoft、Google 及其他 Glasswing 合作夥伴共同起草一份共識性評分標準,用於從四個維度評估越獄:

  1. 能力提升 – 越獄超越現有工具的程度。
  2. 能力提升的廣度 – 越獄可啟用的獨立攻擊任務數量。
  3. 武器化難度 – 將越獄轉化為攻擊所需的人力投入。
  4. 可發現性 – 該技術被發現與重複使用的容易程度。

此框架旨在統一與政府溝通,並優先處理緩解措施。

  • 回應分級:最嚴重的類別(例如可能危及關鍵基礎設施的越獄)將觸發立即部署緩解措施與 24/7 監控。
  • 社群參與:Anthropic 已啟動 HackerOne 計畫,讓研究人員可提交 Fable 5 中的資安越獄發現。

與美國政府深化合作

Anthropic 列出四項具體承諾,以擴展與聯邦機構的合作:

  1. 發布前存取 – 指定政府合作夥伴可提前取得模型與防護機制,進行獨立評估。
  2. 快速分享防護措施 – 重大越獄或濫用模式將迅速通報,並分享新緩解措施供獨立測試。
  3. 專用聯合研究資源 – Anthropic 將分配運算資源與人力,支援政府主導的 AI 安全研究。
  4. 共同產業安全基準 – 與政府及業界夥伴合作,制定自願性、跨產業的安全與評估標準。

這些步驟符合 6 月 2 日發布的《推動先進人工智慧創新與安全行政命令》,旨在建立透明、持久的強大前沿模型發布流程。


對使用者與 AI 生態的影響

  • 對開發者:Fable 5 的進階功能恢復可用,但使用者應預期在日常程式設計任務中偶爾會遇到請求被阻擋的情況。
  • 對資安研究人員:新的 HackerOne 計畫提供明確管道提交越獄發現,並承諾快速緩解。
  • 對政策制定者:Anthropic 的框架與政府合作提供了一個產業自我規範並與監管機構合作的具體範例。
  • 對廣泛的 AI 社群:推動共享越獄嚴重程度分類法,可能成為事實上的標準,降低當新模型繞過技術被發現時的不確定性。

相關公告

  • 提升 Fable 5 的生物安全防護 – 請參閱 Anthropic 的後續文章。
  • Mariano‑Florentino (Tino) Cuéllar 擔任 Anthropic 首席全球事務官 – 扩展公司政策與合作能力。

Sources

相關