OpenAI 準備框架更新

OpenAI 已更新其準備框架,這是一個用於追蹤與準備可能帶來嚴重傷害風險的先進 AI 能力的結構化流程。此更新著重於加強風險優先排序、強化風險最小化的要求,並提供更清晰的操作指引,以評估與治理防護措施。

風險優先排序與標準

OpenAI 使用結構化的風險評估流程,根據能力是否可能導致嚴重傷害來對其進行分類。若一項能力符合五項具體標準,則會被優先列入提前準備:它必須是可行的、可測量的、嚴重的、全新的,且要麼是瞬間發生的,要麼是無法彌補的。

能力類別

此框架將 AI 能力分為兩個主要類別,以管理雙重用途風險與新興威脅:

已追蹤類別

這些是已具備成熟評估與持續防護措施的既定領域。包括:

  • 生物與化學能力
  • 網路安全能力
  • AI 自我改進能力

研究類別

這些領域被識別為可能帶來嚴重傷害風險,但尚未符合成為已追蹤類別的標準。OpenAI 目前正為這些領域開發威脅模型與先進評估,包含:

  • 長程自主
  • 故意表現不佳(Sandbagging)
  • 自主複製與適應
  • 削弱防護措施
  • 核與放射性

說服風險透過模型規範、對政治競選與遊說的限制,以及對影響行動的調查,於此框架之外進行管理。

能力層級與營運承諾

OpenAI 已將其能力層級精簡為兩個門檻,觸發特定的營運要求:

  • 高階能力:可能放大現有導致嚴重傷害路徑的能力。達到此層級的系統必須在部署前具備能「充分降低」相關風險的防護措施。
  • 關鍵能力:可能開創前所未有的新路徑導致嚴重傷害的能力。此類系統在開發與部署階段皆需具備能充分降低相關風險的防護措施。

安全諮詢小組(SAG)是一個由內部安全領導者組成的跨功能團隊,負責審查這些防護措施,並向 OpenAI 領導層提供最終部署決策的建議。SAG 的指導範圍從批准部署到要求進一步的保護或評估。

評估規模化與報告

為了跟上更快的模型改進週期——通常是由推理進步而非大型訓練所驅動——OpenAI 已實施一套自動化評估,以擴大測試規模。這些評估由專家主導的「深度探討」補充,以確保準確性。

報告亦被細分為兩種不同類型的文件:

  • 能力報告:評估模型是否已超過風險門檻。
  • 防護報告:提供防護措施設計與驗證的詳細資訊,遵循「深層防禦」原則。

對前沿環境的回應

OpenAI 表示,若其他前沿 AI 開發者在未具備相當防護措施的情況下發布高風險系統,OpenAI 可能會調整自身的要求。此類調整僅會在嚴格確認風險環境已變化、公開承認此調整,且評估此變更不會顯著提升整體嚴重傷害風險,同時維持保護性防護水平後才會進行。

Sources