OpenAI AI 政策提案與安全框架

OpenAI 已宣布將在美國推動強制性、基於能力的國家級 AI 安全監管,認為 AI 能力的快速進步需要從自願性承諾轉向民主監督。該公司主張,目前正處於一個「政策窗口期」,應在 AI 能力超越負責治理它們的機構之前,建立持久的保障措施。

強制性國家 AI 安全要求

OpenAI 正倡導美國國會實施基於能力且具備演進性的強制性國家 AI 安全監管。提議的框架專注於以下關鍵領域:

  • 針對性應用: 安全要求應專門針對開發最具能力的前沿系統(frontier systems)的少數資源豐富的實驗室,而非新創公司或小規模研究人員。
  • 聯邦框架組成部分: 基於 OpenAI 的「Blueprint for Democratic Governance of Frontier AI」,該公司尋求共同的測試、獨立評估要求、更強的網絡安全保護、明確的事件報告規則,以及追蹤遞歸自我改進(recursive self-improvement)進度的共享措施。
  • 開放與封閉模型的平衡: OpenAI 主張,開放與封閉模型對於美國的領導地位都是必要的,聯邦框架應在處理前沿風險的同時,不扼殺競爭或將創新驅逐至海外。
  • 治理轉型: 目標是將碎片化的私人治理系統(即實驗室自行制定規則)替換為具備民主問責制的標準與獨立驗證。

支持加州州立法

在等待聯邦行動的同時,OpenAI 支持「逆向聯邦主義」(reverse federalism)策略,即透過州級立法建立事實上的國家基準,供國會最終編纂成法。OpenAI 已正式支持四項加州法案:

  • SB 813: 建立一套程序,用以指定合格且獨立的組織來評估 AI 風險。
  • AB 1405: 為 AI 審計師建立註冊、獨立性、透明度與問責制要求。
  • SB 1119: 專注於青少年安全,要求對陪伴型聊天機器人進行年齡確認、風險評估、獨立審計與家長控制。
  • AB 1864: 要求基因合成提供者與實驗台合成設備製造商遵循聯邦篩查標準,以防止 AI 賦能的生物威脅。

遞歸自我改進與研究加速

OpenAI 表示,完全自主的遞歸自我改進(即 AI 獨立驅動後續一代代更強大的 AI)目前尚未發生。然而,該公司指出,AI 已經在加速開發與對齊(alignment)下一代模型的研發過程中的部分環節。

為了管理此點,OpenAI 目標是在人類監督下建立自動化 AI 研究員,以將安全與對齊置於單純的能力增長之上。該公司倡導政府建立共享的安全基準,以決定何時應放緩或停止開發,若兩者發生衝突,應優先考慮安全而非能力增長。

行業標準與監控

OpenAI 正呼籲建立由行業主導的標準,以補充強制性的聯邦保障措施,並特別關注於監控「對齊失效」(misalignment)——即模型追求目標的方式違反了人類意圖。

關鍵的監控與披露提案包括:

  • 安全漏洞通知: 當模型規避安全控制以訪問或更改受保護的系統時,公司應及時提供書面通知。
  • 事件報告: OpenAI 支持聯邦對於嚴重 AI 事件的報告要求,並正在開發自己的框架,用於報告具有重大影響的對齊失效事件。
  • 國際協調: OpenAI 主張,建立用於衡量能力與管理風險的相容國際標準是必要的,因為 AI 研究與失敗可能產生全球性的後果。

內部安全措施

OpenAI 已在其模型開發生命週期中實施了多項內部保障措施,包括:

  • 隔離: 對前沿研究工作負載進行更強的力的隔離。
  • 行為監控:: 在啟用工具(tool-enabled)的訓練與評估期間,擴大對模型行為的監控。
  • Astra 特定保障措施: 對於 Astra 模型,OpenAI 引入了對完整軌跡(包括思維鏈)的全方位監控,以及在內部部署前強制進行的對齊評估門檻。

Sources