Anthropic 第三方模型評估計畫
Anthropic 推出了項新計畫,旨在資助開發第三方評估工具,用以衡量 AI 模型的高階能力與安全風險。此舉旨在解決高品質、與安全相關評估不足的問題,並為更廣泛的 AI 生態系統提供工具,以更有效地評估模型的能力與風險。
評估開發的優先關注領域
Anthropic 正優先資助以下三個主要類別的評估開發:AI 安全等級 (ASL) 評估、高階能力與安全指標,以及建立這些評估所需的基礎設施。
AI 安全等級 (ASL) 評估
這些評估旨在衡量 Anthropic《責任規模化政策》(Responsible Scaling Policy) 中定義的 AI 安全等級,這些等級根據模型的能力,規定了安全與安全保障要求。關鍵關注領域包括:
- 網路安全 (Cybersecurity): 評估重點在於「網路殺傷鏈」(cyber kill chain),包括漏洞發現、漏洞利用開發以及橫向移動。Anthropic 正在尋求類似於新型 Capture The Flag (CTF) 挑戰且不具備公開解答的評估,以避免衡量到單純的記憶能力。
- CBRN 風險: 針對化學、生物、放射性與核能 (CBRN) 風險的評估,特別是模型協助非專家或專家製造威脅,或設計新型且更具危害性的 CBRN 威脅之潛力。
- 模型自主性 (Model Autonomy): 衡量在 AI 研究與開發方面的熟練度(從初級到專家級別)、高階自主行為,以及透過獲取資源或外洩權重 (weights) 來進行自我複製或適應的能力。
- 國家安全風險: 開發預警系統,以識別針對國家與非國家行為者之國防與情報行動的複雜新興風險。
- 社會操縱: 衡量說服相關威脅的放大效應,例如假訊息與操縱,並分離出模型對這些風險的獨特貢獻。
- 錯誤對齊風險 (Misalignment Risks): 監控可能導致模型規避安全機制或破壞組織的危險目標、動機與欺騙行為。
高階能力與安全指標
此類別專注於更廣泛的指標,以理解模型能力強項與 ASL 框架之外的潛在風險:
- 高階科學: 資助開發數萬個新問題與任務,以挑戰研究生級別的知識,包括知識綜合、自主研究執行、新型假設生成,以及透過實驗室學徒制獲得的隱性知識。
- 有害性與拒絕行為 (Harmfulness and Refusals): 改進分類器,以更好地區分雙用途 (dual-use) 與非雙用途資訊,並識別有害的 CBRN 或網路相關輸出。
- 多語言評估: 擴展能力基準測試,以支援更廣泛的全球語言。
- 社會影響: 對有害偏見、歧視、過度依賴、心理影響與經濟影響進行嚴格評估。
基礎設施、工具與方法
Anthropic 正在尋求透過以下方式提高評估開發的效率:
- 無程式碼平台 (No-code Platforms): 提供工具讓不具備程式碼技能的領域專家可以開發並匯出強健的評估工具。
- 模型評分 (Model Grading): 開發多樣化的數據集(包括問題、範例解答、標準答案分數與評分準則),以提高模型擔任其他模型評分者的可靠性。
- 提升試驗 (Uplift Trials): 支援建立高品質研究樣本群體之網絡,以及用於執行大規模受控試驗的工具,藉以比較在有與無模型存取權限的情況下任務表現的差異。
高品質評估的原則
Anthropic 確定了有效評估的十項關鍵特性,以避免常見陷阱並確保結果能反映真實世界的風險:
- 難度足夠: 必須衡量與 ASL-3 或 ASL-4 或人類專家級別行為相關的能力。
- 不在訓練數據中: 必須捕捉捕捉泛化能力而非記憶能力。
- 高效且具備可擴展性: 針對自動化與簡易部署進行優化。
- 高容量: 偏好具有 1,000 到 10,000 個任務的評估,儘管高品質的低容量任務也很有價值。
- 領域專家知識: 由領域專家開發或審核。
- 多樣化格式: 使用基於任務的評估、模型評分評估,或人類試驗,而非僅限於選擇題。
- 專家基準線 (Expert Baselines): 將模型性能與人類專家進行比較。
- 文件化與可重複性: 使用 Inspect 或 METR 等標準。
- 迭代開發: 從小樣本開始,在擴展規模之前先進行精煉化。
- 安全相關的威脅建模: 高分應與重大事故發生的可信風險相關聯。
提案徵求與流程
感興趣的各方可以透過 Anthropic 的申請表單進行提案徵求。提交的內容將進行滾動式審查,並提供各種資助範疇。入選的申請者將有機會與 Anthropic 的 Frontier Red Team、Finetuning 與 Trust & Safety 團隊的領域專家合作,以精煉化其評估工具。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch