OpenAI 前沿風險與準備框架

OpenAI 正透過建立專門的準備團隊和風險知情開發政策(RDP)來實施結構化的災難性風險準備方法。此舉旨在主動識別和緩解前沿 AI 模型所帶來的嚴重風險——這些模型的能力超越了目前先進模型的能力——以確保通用人工智慧(AGI)的安全發展。

準備團隊與風險類別

由 Aleksander Madry 領導的準備團隊整合能力評估、評估和內部紅隊演練,以追蹤和預測災難性風險。該團隊專注於四個主要風險類別:

  • 化學、生物、放射性和核子(CBRN)威脅: 與危險材料的創建或部署相關的風險。
  • 網路安全: AI 提升網路攻擊規模或複雜度的潛力。
  • 自主複製與適應(ARA): 與能夠自我複製或獨立演進的 AI 系統相關的風險。
  • 個人化說服: 利用 AI 大規模操縱或說服個人。

風險知情開發政策(RDP)

為了管理開發流程,OpenAI 正維持一項風險知情開發政策(RDP)。該政策建立了一個正式框架,用於:

  1. 評估與監控: 開發嚴謹的方法來評估前沿模型的能力。
  2. 保護行動: 根據已識別的風險等級,創建一系列回應和防護措施。
  3. 治理: 在開發生命週期內建立問責與監督的結構。

該 RDP 旨在補充模型部署前後進行的現有風險緩解與對齊工作。

AI 準備挑戰與「未知未知」

作為其「未知未知」工作流的一部分,OpenAI 舉辦了準備挑戰,以凸顯不顯而易見的風險領域。該挑戰向十個提出合理但獨特風險情境的頂尖提交作品頒發了 25,000 美元的 API 點數。

挑戰的主要發現

對提交作品的分析顯示,約 70% 的參賽者指出惡意說服能力的增強——包括線上激進化、兩極化和政治影響——為主要威脅。其他被識別的風險包括:

  • 財務穩定: 在戰略重要國家引發金融危機。
  • 資訊安全: 增加逆向工程機密資訊或在公共場合識別私人資訊的可能性。
  • 公共安全: 透過無線電頻率干擾飛行路徑或干擾醫藥劑量。
  • 網路犯罪: 擴大勒索贖金的網路攻擊,導致電腦故障。
  • 社交工程: 識別勒索和詐騙的目標。

OpenAI 指出,這些提交作品是根據技術嚴謹性、獨特性、潛在損害規模和清晰度進行評估的,特別強調了 AI 工具相較於非 AI 方法提供明顯優勢的案例。

Sources