OpenAI AI 政策提案與安全框架
OpenAI 已宣布將在美國推動強制性、基於能力的國家級 AI 安全監管,認為 AI 能力的快速進步需要從自願性承諾轉向民主監督。該公司主張,目前正處於一個「政策窗口期」,應在 AI 能力超越負責治理它們的機構之前,建立持久的保障措施。
強制性國家 AI 安全要求
OpenAI 正倡導美國國會實施基於能力且具備演進性的強制性國家 AI 安全監管。提議的框架專注於以下關鍵領域:
- 針對性應用: 安全要求應專門針對開發最具能力的前沿系統(frontier systems)的少數資源豐富的實驗室,而非新創公司或小規模研究人員。
- 聯邦框架組成部分: 基於 OpenAI 的「Blueprint for Democratic Governance of Frontier AI」,該公司尋求共同的測試、獨立評估要求、更強的網絡安全保護、明確的事件報告規則,以及追蹤遞歸自我改進(recursive self-improvement)進度的共享措施。
- 開放與封閉模型的平衡: OpenAI 主張,開放與封閉模型對於美國的領導地位都是必要的,聯邦框架應在處理前沿風險的同時,不扼殺競爭或將創新驅逐至海外。
- 治理轉型: 目標是將碎片化的私人治理系統(即實驗室自行制定規則)替換為具備民主問責制的標準與獨立驗證。
支持加州州立法
在等待聯邦行動的同時,OpenAI 支持「逆向聯邦主義」(reverse federalism)策略,即透過州級立法建立事實上的國家基準,供國會最終編纂成法。OpenAI 已正式支持四項加州法案:
- SB 813: 建立一套程序,用以指定合格且獨立的組織來評估 AI 風險。
- AB 1405: 為 AI 審計師建立註冊、獨立性、透明度與問責制要求。
- SB 1119: 專注於青少年安全,要求對陪伴型聊天機器人進行年齡確認、風險評估、獨立審計與家長控制。
- AB 1864: 要求基因合成提供者與實驗台合成設備製造商遵循聯邦篩查標準,以防止 AI 賦能的生物威脅。
遞歸自我改進與研究加速
OpenAI 表示,完全自主的遞歸自我改進(即 AI 獨立驅動後續一代代更強大的 AI)目前尚未發生。然而,該公司指出,AI 已經在加速開發與對齊(alignment)下一代模型的研發過程中的部分環節。
為了管理此點,OpenAI 目標是在人類監督下建立自動化 AI 研究員,以將安全與對齊置於單純的能力增長之上。該公司倡導政府建立共享的安全基準,以決定何時應放緩或停止開發,若兩者發生衝突,應優先考慮安全而非能力增長。
行業標準與監控
OpenAI 正呼籲建立由行業主導的標準,以補充強制性的聯邦保障措施,並特別關注於監控「對齊失效」(misalignment)——即模型追求目標的方式違反了人類意圖。
關鍵的監控與披露提案包括:
- 安全漏洞通知: 當模型規避安全控制以訪問或更改受保護的系統時,公司應及時提供書面通知。
- 事件報告: OpenAI 支持聯邦對於嚴重 AI 事件的報告要求,並正在開發自己的框架,用於報告具有重大影響的對齊失效事件。
- 國際協調: OpenAI 主張,建立用於衡量能力與管理風險的相容國際標準是必要的,因為 AI 研究與失敗可能產生全球性的後果。
內部安全措施
OpenAI 已在其模型開發生命週期中實施了多項內部保障措施,包括:
- 隔離: 對前沿研究工作負載進行更強的力的隔離。
- 行為監控:: 在啟用工具(tool-enabled)的訓練與評估期間,擴大對模型行為的監控。
- Astra 特定保障措施: 對於 Astra 模型,OpenAI 引入了對完整軌跡(包括思維鏈)的全方位監控,以及在內部部署前強制進行的對齊評估門檻。