Anthropic 與 Accenture 合作推動前沿 AI 的嵌入式評估
Anthropic 已與 Accenture 合作實施「嵌入式評估」(embedded evaluation),這是一項由獨立評估人員在 AI 公司內部工作,以驗證安全承諾並評估模型開發的過程。此合作旨在透過提供外部專家員工級別的存取權限,使其能接觸訓練過程與內部決策,從而提高 AI 安全性的可驗證性。
嵌入式評估模式
嵌入式評估與傳統的外部評估不同,它授予獨立評估人員與員工相當的存取權限。這種內部視角使評估人員能夠:
監控模型開發: 在訓練階段觀察模型的成形過程。
審計內部治理: 追蹤決定模型如何構建與部署的決策。
直接與員工互動: 直接與員工對話,以識別盲點並評估操作安全性。
公開報告: 報告事件,並向公眾提供關於模型相關風險與益處更具資訊性的說明。
Anthropic 表示,雖然這些評估人員提供驗證,但模型安全的最終責任仍由 AI 開發者承擔。
合作範圍與投資
此合作由 Accenture 的專業 AI 業務部門 Faculty 主導。工作範圍包括評估與紅隊測試模型、進行對齊評估以及測試模型安全措施。Accenture 在跨各行業及政府部署 AI 的經驗,旨在為這些評估期間使用的安全方法提供參考。
Anthropic 與 Accenture 均預計在未來五年內各自投資至少 10 億美元,以在此領域建立能力。
資金與標準化挑戰
由於目前尚無針對嵌入式評估人員資訊存取或報告的既定標準,也沒有確立的資金系統,目前的安排如下:
直接資金: 由於此倡議的重要性與緊迫性,Anthropic 將直接資助 Accenture 的工作。
替代資金試點: Anthropic 正與 METR 及其他非營利評估機構進行對話,以試點使用其自身獨立資金進行嵌入式評估。
長期目標: Anthropic 倡議資金最終應來自集資或政府來源,如其六月發布的《先進 AI 框架》(Advanced AI Framework)中所建議。
生態系統與非獨佔性
此合作具有非獨佔性。Anthropic 意圖與多個評估組織合作,未來幾週將公布更多細節。同樣地,Accenture 也將以類似角色與其他 AI 開發者合作。目標是隨著前沿 AI 領域的成熟,建立一個在共同標準下運作的評估人員生態系統。