Anthropic Frontier Red Team Progress Report

Anthropic 的 Frontier Red Team 已觀察到 AI 模型在雙用途能力方面正顯示出快速進步的「早期預警」跡象,特別是在網路安全與生物學領域。雖然模型在網路安全領域正接近或超過大學部程度的技能,且在某些生物領域具備專家級知識,但目前尚未達到會對國家安全產生實質性提升風險的門檻。

Rapid Advancement in Cybersecurity Capabilities

AI 在網路領域的能力已在一年內從基礎水平轉變為大學部程度的熟練度。這種進步可以從 Capture The Flag (CTF) 練習和公開基準測試的表現中得到證實:

  • CTF Performance: Claude 在不到一年的時間內,從解決不到 25% 的 Intercode CTF 挑戰(專為高中生設計)進步到幾乎能解決所有的挑戰。
  • Cybench Benchmark: Claude 3.7 Sonnet 在五次嘗試內能解決大約三分之一的 Cybench 挑戰,相較於前一年尖端模型 5% 的成功率有顯著提升。
  • Task Diversity: 在多個類別中都觀察到了進步,包括發現並利用遠端伺服器的漏洞("pwn")、網頁應用程式("web")以及加密協定("crypto")。

儘管取得了這些進步,Claude 在逆向工程二進位執行檔,以及在沒有協助的情況下於網路環境中進行偵察與攻擊利用,方面仍落後於人類專家。

Network-Scale Cyber Operations

透過與 Carnegie Mellon University 合作,Anthropic 在由大約 50 台主機組成的真實網路範圍(cyber ranges)進行了模型測試。雖然模型目前還無法在這些環境中自主成功,但當配備如 Incalmo 等專業化軟體工具時,它們可以複製大規模的個人識別資訊竊取(類似於 Equifax 遭竊事件)。這種基礎設施允許 Anthropic 監控自主能力提升的時刻。

Progress and Gaps in Biosecurity Knowledge

Claude 在生物學理解方面的進步神速,在一年內從表現不如世界級病毒學專家,轉變為在 VCT 評估(解決病毒學任務)中輕鬆地超過該基準線。

Biological Expertise vs. Practical Risk

生物學能力在不同任務中表現並不均衡:

  • Strengths: Claude 3.7 Sonnet 在理解生物協定以及操作 DNA 與蛋白質序列方面,已接近人類專家基準線,並且在複製流程(cloning workflows)方面超過了人類專家基準線。
  • Weaknesses: 模型在解讀科學圖表方面仍遜於人類專家。

關於武器化風險,小型受控研究顯示,雖然最新的模型與僅具備網路存取權限的模型相比,能為新手提供一些提升,但產生的計畫仍包含關鍵錯誤,會導致現實世界的失敗。專家紅隊測試(red-teaming)得出結論,目前規劃中的關鍵失敗次數過高,尚無法讓一名新手惡意行為者實現端到端的攻擊執行。

Strategic Partnerships and Safety Frameworks

Anthropic 利用責任規模政策(Responsible Scaling Policy, RSP)來承諾達到觸發更高安全等級的技術能力門檻。為了驗證這些風險,實驗室採用了幾種外部合作夥伴關係:

  • AI Safety/Security Institutes: 模型在部署前會接受美國與英國 AI Safety Institutes (AISI) 的測試,這為 Claude 3.7 Sonnet 的 AI Safety Level (ASL) 判定提供了依據。
  • National Nuclear Security Administration (NNSA): Anthropic 與美國能源部的 NNSA 合作,在機密環境中評估 Claude 在核能與放射性風險知識方面的表現。

Future Outlook and Risk Mitigation

Anthropic 正擴大進行更頻繁、自動化的評估,以便更早地偵測到風險。實驗室指出,隨著模型在「延伸思考」(extended thinking)方面的提升,隨著模型變得更加具備「開箱即用」的能力,對 Incalmo 等外部工具包的需求可能會減少。

基於目前的生物學研究,Anthropic 認為其模型正接近需要 AI Safety Level 3 (ASL-3) 防護措施的能力門檻,這將促使增加對必要安全措施的投資。

Sources

相關