Anthropic 負責任擴展政策 3.0 版本
Anthropic 已發佈其負責任擴展政策 (Responsible Scaling Policy, RSP) 的 3.0 版本,這是一個旨在隨著 AI 能力提升而減輕災難性風險的自願性框架。此次更新將政策從嚴格的「如果-那麼」能力閾值,轉向更務實的方法,區分了 Anthropic 可以單方面實現的目標與需要產業或政府集體行動的部分。
結構性轉變:單方面與多邊緩解措施
Anthropic 重組了 RSP,將其內部營運計畫與針對 AI 產業的更廣泛安全建議分開。這一改變應對了某些高層級防護措施單一公司無法獨自實施的現實。
- 單方面承諾: RSP 現在概述了 Anthropic 將獨立於其他產業參與者之外進行的特定緩解措施。
- 產業建議: 該政策包含了一份雄心勃勃的能力與緩解措施對照圖,旨在作為整個 AI 產業集體管理進階風險的藍圖。
前沿安全路線圖 (Frontier Safety Roadmap)
3.0 版本引入了 Frontier Safety Roadmap,這是一份公開文件,詳細說明了在四個關鍵領域的雄心勃勃但可實現的目標:安全性 (Security)、對齊 (Alignment)、防護措施 (Safeguards) 與政策 (Policy)。雖然這些目標不具約束力,但它們作為內部驅動力與進度的公開基準。
路線圖中的關鍵目標包括:
- 資訊安全: 啟動「登月級研發」計畫,以實現前所未有的安全水平。
- 自動化紅隊測試: 開發自動化紅隊測試方法,其有效性需超過人類漏洞賞金參與者。
- 憲法遵循: 實施系統化措施,以確保模型行為符合 Anthropic 的憲法。
- 內部監督: 建立關鍵開發活動的集中式記錄,以偵測內部威脅(包括人類與 AI)及安全漏洞。
- 監管指引: 發佈政策路線圖,提出「監管階梯」,使政策隨風險增加而按比例擴展。
風險報告與外部審查
為了提高透明度,Anthropic 正在實施每 3 到 6 個月發佈一次 Risk Reports 的系統化做法。這些報告提供了當前模型的全面安全概況,詳細說明了能力、威脅模型與主動緩解措施之間的交集。
外部驗證
在特定情況下,RSP 現在要求對這些 Risk Reports 進行外部審查。Anthropic 將委任第三方專家——需無利益衝突且熟悉 AI 安全研究——來查閱未經刪減的報告,並將公司的推理與決策過程置於公開審查之下。雖然目前的模型尚未觸發此項要求,但 Anthropic 目前正在試行此流程。
回顧:RSP v1 與 v2 的成功與失敗
Anthropic 向 3.0 版本過渡的決策是基於對其先前政策進行了為期兩年半的評估。
成功之處
- 內部激勵: RSP 成功促成了更強大的防護措施開發,例如用於符合 ASL-3 (AI Safety Level 3) 標準的輸入與輸出分類器。
- 產業影響力: 該框架鼓勵了其他實驗室,包括 OpenAI 與 Google DeepMind,採用類似的安全框架,並為加州 (SB 53)、紐約 (RAISE Act) 以及歐盟 (AI Act's Codes of Practice) 等司法管轄區的早期 AI 政策提供了參考。
未成功之處
- 能力閾值: 「模糊地帶」使得難以確定模型何時精確地通過了特定的能力閾值。例如,在生物風險方面,模型可能通過了簡單測試,但無法提供高風險的決定性證據,這使得很難為採取行動建立多邊性的論據。
- 政府步調: 政府在 AI 安全方面的行動比預期緩慢,政治氣候往往優先考慮經濟增長與競爭力,而非安全監管。
- 單方面限制: 某些高層級安全標準(例如 RAND 報告中提到的「SL5」標準)目前被認為若沒有國家安全界的協助,是無法實現的。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch