Anthropic 理解與應對 AI 危害的框架

Anthropic 已實施一套結構化框架,用以識別、評估並減輕廣泛的 AI 相關危害,範圍從兒童安全、虛假訊息到災難性的生物威脅。這種方法讓實驗室能夠按比例管理風險,確保安全防護措施不會不必要地阻礙 AI 系統的實用性與功能性。

危害評估的多維度框架

Anthropic 從五個基準維度來評估潛在的 AI 影響,以確保對風險有全面的理解。這種結構化方法讓團隊能夠清晰地溝通,並針對已知與新興的危害開發具體的解決方案。

這五個影響維度為:

  • 身體影響: 對身體健康與福祉的影響。
  • 心理影響: 對心理健康與認知功能的影響。
  • 經濟影響: 財務後果與財產考量。
  • 社會影響: 對社群、機構與共享系統的影響。
  • 個人自主權影響: 對個人決策與自由的影響。

為了確定這些影響在現實世界中的重要性,Anthropic 會根據包括可能性、規模、受影響的人群、持續時間、因果關係、技術貢獻度以及減輕可行性等因素來評估每個維度。

與安全政策與執行的整合

此危害評估框架與專注於災難性風險的《責任規模政策》(Responsible Scaling Policy, RSP) 相輔成成。雖然 RSP 管理極端情境,但更廣泛的框架透過幾項整合的政策與實務來應對更廣泛的潛在影響:

  • 使用政策: 維持一套完整的可接受使用規則。
  • 評估: 在模型發布前後進行紅隊測試 (red teaming) 與對抗性測試。
  • 偵測: 利用尖端技術來識別誤用與濫用。
  • 執行: 採取從修改提示詞 (prompt) 到封鎖帳號等一系列措施。

在模型能力與行為上的應用

Anthropic 在開發新功能或優化模型回應時,會應用此框架來評估模型實用性與安全限制之間的權衡。

電腦使用能力 (Computer Use Capabilities)

在開發模型與電腦介面互動的能力時,Anthropic 會分析涉及的軟體與情境,以識別必要的防護措施。特別關注金融軟體與銀行平台以防止詐騙與操縱,以及通訊工具以防止網路釣魚與針對性的影響行動。為了在實用性與安全性之間取得平衡,Anthropic 採用了新型的執行方法,例如層級式摘要 (hierarchical summarization),這能在偵測危害的同時維持隱私標準。

模型回應邊界

Anthropic 使用此框架來管理「過度索引」(over-indexing) 無害性(這會導致不必要的拒絕)與過太過於實用(這可能導致有害行為)之間的緊張關係。

在開發 Claude 3.7 Sonnet 時,這種方法被用於評估沿著實用性與安全性的光譜進行請求。透過改進模型處理模糊提示詞的方式,Anthropic 在維持對有害內容強大防護的同時,將不必要的拒絕率降低了 45%。這種細緻的方法對於保護弱勢族群(包括兒童、邊緣化社群與處於危機中的個人)尤為關鍵。

未來展望與協作

Anthropic 將此框架視為其整體安全策略中不斷演進的組成部分。實驗室承認,隨著 AI 能力的進步,新的且無法預見的挑戰將會出現,這需要評估方法與框架的持續調整。Anthropic 已邀請研究人員、政策專家與產業夥伴透過 usersafety@anthropic.com 進行協作。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch