Anthropic 前沿威脅紅隊測試:AI 安全防護

概述

Anthropic 推出了「前沿威脅紅隊測試」方法,以識別並減輕可能對國家安全構成風險的 AI 能力,例如生物安全與網路安全。此對抗性測試框架旨在揭露可能被惡意行為者利用的模型潛在能力,超越一般群眾式紅隊測試,轉向由專家主導的專門評估。

前沿威脅紅隊測試的方法論

前沿威脅紅隊測試需要大量投入領域專業知識與時間,以挖掘模型的潛在能力。Anthropic 的流程包含以下關鍵組成部分:

  • 專家合作: 過程從與擁有數十年經驗的領域專家合作開始,定義威脅模型。這些模型會識別哪些資訊具有危險性、這些資訊如何結合造成傷害,以及資訊的準確性與頻率需達到何種程度才具危險性。
  • 深度探測: 領域專家與 LLM 專家投入大量時間(100 小時以上)與模型互動,探測其能力。這包括學習如何「越獄」模型,以繞過安全過濾機制。
  • 自動化評估: 主要目標是基於專家知識,開發新的自動化評估方法與工具,使測試流程具備可重複性與可擴展性。
  • 安全基礎設施: 由於所揭露的資訊極度敏感,此工作透過與值得信賴的第三方合作,並實施強大的資訊安全保護措施進行。

生物安全紅隊測試的發現

Anthropic 進行了一項專注於生物風險的測試專案,與生物安全專家合作超過 150 小時,使用無公開信任與安全監控的封閉介面進行。

關鍵風險識別

  • 專家級知識: 前沿模型偶爾能產出高階、精確且詳細的專家級知識。隨著模型規模擴大,此能力亦持續提升。
  • 危害加速: 未經緩解的 LLM 可能加速惡意行為者濫用生物技術的進程,遠超單純使用搜尋引擎的效率,使原本不可能完成的任務成為可能。雖然目前影響尚小,但正快速增長。
  • 近期時間軸: Anthropic 評估,若未採取緩解措施,這些生物風險可能在未來兩到三年內實現,而非原先預期的五年或更久。

已實施的緩解措施

Anthropic 發現,透過特定干預措施,這些風險可大幅降低:

  • 訓練流程調整: 調整訓練流程,例如使用 Constitutional AI 的方法,有助於模型更清楚區分有害與無害的生物應用。
  • 基於分類器的過濾: 這些過濾機制使行為者更難取得造成傷害所必需的串連專家級資訊。目前這些緩解措施已部署於 Anthropic 的公開前沿模型中。

未來研究與產業影響

Anthropic 認為,當前前沿模型的狀態對產業而言是一次「警告訊號」。公司正聚焦於以下未來方向:

  • 速度提升比較分析: 衡量 LLM 在下一代、具工具使用能力與多模態模型中,相較於傳統搜尋引擎,對製造危害的加速程度。
  • 開源權重模型風險: Anthropic 警告,惡意行為者可能從較小、微調過的模型中提取有害的生物能力,這些模型是基於公開可取得、足夠強大的基礎模型權重所調整而成。
  • 協作式揭露機制: Anthropic 正建立揭露流程,將風險與緩解措施報告給其他實驗室與政府機構。
  • 第三方評估: 公司倡議建立中立的第三方組織,進行國家安全評估,並對敏感資訊實施適當的保護措施。

研究議程的擴展

Anthropic 正擴充其前沿威脅紅隊測試團隊,以實驗未來能力並建立可擴展的評估方法。此框架旨在應用於其他長期風險,例如模型欺騙,透過識別應避免的未來能力,並在這些能力出現前建立對齊技術。

Sources

相關