Anthropic 與 NNSA 開發 AI 核能安全防護分類器
Anthropic 已與美國能源部 (DOE) 及國家核安全管理局 (NNSA) 合作,開發出一種專門的 AI 分類器,旨在檢測並防止 AI 模型被誤用於核武器開發。此次合作建立了一種公私合作模式,用於評估與監測前沿 AI 模型中的核擴散風險。
核擴散風險監測
Anthropic 與 NNSA 及 DOE 國家實驗室共同開發了一種 AI 分類器,可自動對核能相關對話進行分類。該系統旨在區分良性的核能討論與那些顯示出令人擔憂的核擴散風險的討論。
在初步測試中,該分類器達到了 96% 的準確度。此工具已部署於 Claude 的流量中,作為識別模型誤用之更廣泛系統的一部分。
公私合作框架
對於私營公司而言,評估核能風險具有挑戰性,因為評估所需的資訊高度敏感。為了應對這一點,Anthropic 於 2024 年 4 月與 NNSA 合作,評估模型的擴散風險。
此夥伴關係結合了政府在核安全方面的專業知識與產業在 AI 開發方面的能力。Anthropic 打算與 Frontier Model Forum 分享其方法,為其他 AI 開發者提供藍圖,以便與 NNSA 協調並實施類似的安全防護措施。
國家安全影響
由於核能技術具有雙重用途——即相同的物理原理同時適用於發電與武器開發——因此必須對前沿 AI 模型進行監測,以確保它們不會向用戶提供可能威脅國家安全的危險技術知識。這項工作是更廣泛策略的一部分,旨在透過直接應對高風險安全風險,使 AI 模型更加可靠且值得信賴。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch