人工智慧的信任建立措施
基礎模型的國際安全風險
- 意外與非預期升級: AI 驅動的錯誤可能導致非預期衝突的潛在風險。
- 非預期衝突: 來源於對 AI 能力或意圖的誤解所產生的風險。
- 武器擴散: AI 能力促成的武器擴散。
- 外交干擾: AI 系統對人類外交的干擾。
提議的信任建立措施(CBM)
信任建立措施起源於冷戰,是用來降低敵意、增進信任的靈活工具。工作坊參與者確定了六項直接適用於基礎模型的具體 CBM:
- 危機熱線: 建立直接溝通管道以管理緊急安全問題。
- 事件共享: 報告並分享與 AI 相關安全事件的資訊過程。
- 模型、透明度與系統卡: 利用標準化文件來提供模型能力與限制的清晰說明。
- 內容來源與浮水印: 實施技術標記以驗證內容來源並防止錯誤資訊。
- 合作紅隊演練與桌上演習: 參與聯合壓力測試模型以識別漏洞。
- 資料集與評估共享: 分享用於評估模型安全與效能的資料與基準。
實施與利益相關者參與
由於大多數基礎模型開發者為非政府實體,這些 CBM 的實施無法僅依賴國家間協議。相反,這些措施必須涵蓋更廣泛的利益相關者社群,包括 AI 實驗室與政府行為者。這些 CBM 可由 AI 實驗室自行實施,或由相關政府機構實施,以確保穩定且安全的國際環境。