Anthropic 負責任擴展政策 3.0 版本

Anthropic 已發佈其負責任擴展政策 (Responsible Scaling Policy, RSP) 的 3.0 版本,這是一個旨在隨著 AI 能力提升而減輕災難性風險的自願性框架。此次更新將政策從嚴格的「如果-那麼」能力閾值,轉向更務實的方法,區分了 Anthropic 可以單方面實現的目標與需要產業或政府集體行動的部分。

結構性轉變:單方面與多邊緩解措施

Anthropic 重組了 RSP,將其內部營運計畫與針對 AI 產業的更廣泛安全建議分開。這一改變應對了某些高層級防護措施單一公司無法獨自實施的現實。

  • 單方面承諾: RSP 現在概述了 Anthropic 將獨立於其他產業參與者之外進行的特定緩解措施。
  • 產業建議: 該政策包含了一份雄心勃勃的能力與緩解措施對照圖,旨在作為整個 AI 產業集體管理進階風險的藍圖。

前沿安全路線圖 (Frontier Safety Roadmap)

3.0 版本引入了 Frontier Safety Roadmap,這是一份公開文件,詳細說明了在四個關鍵領域的雄心勃勃但可實現的目標:安全性 (Security)、對齊 (Alignment)、防護措施 (Safeguards) 與政策 (Policy)。雖然這些目標不具約束力,但它們作為內部驅動力與進度的公開基準。

路線圖中的關鍵目標包括:

  • 資訊安全: 啟動「登月級研發」計畫,以實現前所未有的安全水平。
  • 自動化紅隊測試: 開發自動化紅隊測試方法,其有效性需超過人類漏洞賞金參與者。
  • 憲法遵循: 實施系統化措施,以確保模型行為符合 Anthropic 的憲法。
  • 內部監督: 建立關鍵開發活動的集中式記錄,以偵測內部威脅(包括人類與 AI)及安全漏洞。
  • 監管指引: 發佈政策路線圖,提出「監管階梯」,使政策隨風險增加而按比例擴展。

風險報告與外部審查

為了提高透明度,Anthropic 正在實施每 3 到 6 個月發佈一次 Risk Reports 的系統化做法。這些報告提供了當前模型的全面安全概況,詳細說明了能力、威脅模型與主動緩解措施之間的交集。

外部驗證

在特定情況下,RSP 現在要求對這些 Risk Reports 進行外部審查。Anthropic 將委任第三方專家——需無利益衝突且熟悉 AI 安全研究——來查閱未經刪減的報告,並將公司的推理與決策過程置於公開審查之下。雖然目前的模型尚未觸發此項要求,但 Anthropic 目前正在試行此流程。

回顧:RSP v1 與 v2 的成功與失敗

Anthropic 向 3.0 版本過渡的決策是基於對其先前政策進行了為期兩年半的評估。

成功之處

  • 內部激勵: RSP 成功促成了更強大的防護措施開發,例如用於符合 ASL-3 (AI Safety Level 3) 標準的輸入與輸出分類器。
  • 產業影響力: 該框架鼓勵了其他實驗室,包括 OpenAI 與 Google DeepMind,採用類似的安全框架,並為加州 (SB 53)、紐約 (RAISE Act) 以及歐盟 (AI Act's Codes of Practice) 等司法管轄區的早期 AI 政策提供了參考。

未成功之處

  • 能力閾值: 「模糊地帶」使得難以確定模型何時精確地通過了特定的能力閾值。例如,在生物風險方面,模型可能通過了簡單測試,但無法提供高風險的決定性證據,這使得很難為採取行動建立多邊性的論據。
  • 政府步調: 政府在 AI 安全方面的行動比預期緩慢,政治氣候往往優先考慮經濟增長與競爭力,而非安全監管。
  • 單方面限制: 某些高層級安全標準(例如 RAND 報告中提到的「SL5」標準)目前被認為若沒有國家安全界的協助,是無法實現的。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch