Anthropic Frontier Model Security Framework

TL;DR

Anthropic 提出了針對前沿 AI 模型的一套網路安全最佳實踐,強調這些模型的戰略重要性需要超越標準商業技術的安全水平。

Multi-Party Authorization for AI-Critical Infrastructure

Anthropic 主張「雙人控制」(two-party control),這是一種安全模式,即沒有單一人員可以持續訪問生產環境中的關鍵環境。為了獲得訪問權限,個人必須向同事請求限時許可,並提供業務理由。

Secure Model Development Framework

為了確保 AI 系統的完整性和來源,Anthropic 建議採用基於現有軟體安全標準的 secure model development framework

Public-Private Cooperation and Regulatory Approach

Anthropic 建議將前沿 AI 研究視為「關鍵基礎設施」,類似於金融服務業。這種指定將促進政府機構與 AI 實驗室之間的資訊共享與合作,以更好地防禦資源豐富的惡意行為者。

Implementation Status

Anthropic 目前正在實施雙人控制、SSDF 和 SLSA。該公司承認,雖然安全措施有時會可能會干擾生產力,但隨著模型能力的擴展,這些預防措施是必要的,並將需要透過與行業和政府夥伴的諮詢來進行迭代增強。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch