OpenAI 安全實踐

OpenAI 概述了十項核心安全實踐,以確保業界領先的 AI 模型的開發與部署保持安全可靠。此框架從一開始就將安全措施納入開發流程,從對現有模型的對齊轉向為更具能力的未來系統做準備。

模型評估與風險緩解

OpenAI 在任何發布前都會進行實證模型紅隊測試與測試。此流程受「Preparedness Framework」管控,該框架設定風險門檻。若新模型跨過「Medium」風險門檻,則不會發布,直至實施安全干預,使緩解後的分數回到「Medium」。

在 GPT-4o 的發布過程中,超過 70 位外部專家參與了紅隊工作,以識別早期檢查點的弱點,進而為後續檢查點的評估提供資訊。

對齊與安全研究

安全改進由模型智慧的提升(降低事實錯誤與有害輸出)以及對實務對齊、安全系統與訓練後研究的有針對性投資共同驅動。重點領域包括:

  • Fine-tuning data: 提升人類生成資料的品質。
  • Model Specifications: 精緻模型所訓練遵循的指令。
  • Robustness: 進行並發表研究,以提升系統對諸如 jailbreak 等攻擊的韌性。

監控與濫用防止

OpenAI 使用廣泛的工具來監測其 API 與 ChatGPT 中的安全風險與濫用情形。這包括使用專屬審核模型,並利用 GPT-4 自動化內容政策制定與內容審核決策,從而減少暴露給人工審核員的濫用資料量。

為提升全產業的安全性,OpenAI 與 Microsoft 共同披露了關於國家行為者濫用其技術的發現。

生命周期與專門安全焦點

OpenAI 在整個模型生命周期中實施安全措施,從預訓練到部署皆涵蓋。這包括投資於預訓練資料安全、系統層級行為導向,以及健全的監控基礎設施。

具體的高優先級安全領域包括:

兒童安全

OpenAI 已在 ChatGPT 與 DALL·E 中整合預設防護措施,以減輕對兒童的傷害。2023 年,該公司與 Thorn 的 Safer 合作,當使用者嘗試將此類內容上傳至影像工具時,偵測並向全國失蹤與被剝削兒童中心(National Center for Missing and Exploited Children)通報兒童性剝削資料(CSAM)。

選舉完整性

為防止濫用並確保透明度,OpenAI 推出了辨識 DALL·E 3 圖像的工具,並加入 C2PA 中繼資料,協助使用者辨識媒體來源。此外,ChatGPT 會將使用者導向美國與歐洲的官方投票資訊來源,且該公司支持美國參議院的「防止欺騙性 AI 破壞選舉法案」(Protect Elections from Deceptive AI Act)。

影響評估與安全

OpenAI 進行影響評估,以衡量 AI 相關的風險,包括化學、生物、放射與核(CBRN)風險。公司亦研究語言模型對各種職業與產業的影響程度,並分析語言模型對影響作戰的意涵。

保護智慧財產與資料的安全措施包括:

  • API-based deployment: 透過 API 控制存取,以實施政策執行。
  • Infrastructure security: 依據需要知情原則限制對訓練環境與演算法機密的存取。
  • Cybersecurity programs: 實施內部與外部滲透測試、漏洞懸賞計畫,以及針對第三方研究人員的網路安全補助計畫。
  • Future controls: 探索 GPU 的機密運算以及 AI 驅動的網路防禦。

治理與政府合作

OpenAI 與全球各國政府合作,提供 AI 安全政策的資訊,分享經驗並試點第三方保證。

在內部,安全決策透過一套營運結構管理:跨功能的安全諮詢小組審查能力報告並提出建議,公司領導層作最終決策,董事會則提供監督。

未來演變

OpenAI 承認,隨著邁向下一代前沿模型,必須演進其實踐。這包括提升安全姿態,以抵禦複雜的國家行為者攻擊,並在重大發布前分配更多時間進行安全測試。

Sources