Anthropic 與 NNSA 共同開發 AI 核安全防護分類器
Anthropic 與美國能源部(DOE)及國家核安全管理局(NNSA)共同開發了一款專用的 AI 分類器,用於檢測並防止 AI 模型被濫用於核武器研發。此合作建立了公私部門合作的框架,以確保前沿 AI 模型免受國家安全威脅,同時維持模型在合法科學與教育用途上的實用性。
用於核擴散風險的 AI 分類器
Anthropic 與 NNSA 建立了一套自動化分類系統,旨在區分具有潛在風險的核相關對話與無害的討論。在使用合成資料進行的初步測試中,該分類器整體準確率達到 96.2%,對核武器相關提問的檢測率為 94.8%,且零誤報。
開發流程
該分類器透過反覆的紅隊測試與驗證循環開發而成:
- 風險指標識別:經過一年在安全環境中對 Claude 模型進行 NNSA 紅隊測試後,NNSA 提供了一組經篩選的核風險指標。這些指標以可共享的分類等級開發,使 Anthropic 的政策與安全團隊得以使用。
- 分類器建構:Anthropic 將這些風險指標轉化為即時分類器,其運作方式類似於垃圾郵件過濾器,將對話標記為可能有害或無害。
- 合成資料驗證:為克服國家安全機構與私營公司之間的資訊共享限制,團隊採用合成資料生成技術。Anthropic 基於 NNSA 的範例生成數百個測試提示,NNSA 隨後進行驗證,確保分類器得分與預期標籤一致。
- 優化調整:根據 NNSA 的反饋,透過反覆測試與改進的循環對系統進行優化。
實際部署與表現
該分類器目前作為實驗性模組部署於 Anthropic 的安全防護框架中,監控部分 Claude 流量。實際資料已證實該工具在真實環境中的有效性,超越了合成測試環境的表現。
處理灰色地帶與上下文
部署資料顯示,真實對話比合成資料更為複雜。例如,分類器偶爾會將關於中東當前事件的無害對話標記為可疑。Anthropic 透過使用 層級摘要(hierarchical summarization)技術來減少這些誤報,該技術會整合多個被標記的對話,提供必要的上下文以識別其為無害。
透過對抗測試進行驗證
該分類器的有效性在對抗測試中進一步得到證明:即使 Anthropic 自身的紅隊成員在例行測試中使用了可疑提示,分類器仍成功識別出這些內容,而紅隊成員當時並未意識到分類器已部署。
產業影響與藍圖建立
Anthropic 正將其方法分享給前沿模型論壇(Frontier Model Forum),鼓勵其他 AI 開發者實施類似防護機制。透過結合政府領域專業知識與產業技術能力,此合作為如何透過自願性的公私合作,應對跨領域高風險國家安全威脅,提供了一個可複製的藍圖。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch