GPT‑4o 系統卡 – 功能、 安全緩解措施與風險評估

TL;DR

OpenAI 發布了 GPT‑4o 系統卡,這是一份針對其新全能模型(可處理文字、音訊、影像與影片)的完整安全與功能報告,顯示該模型在達成效能目標的同時,透過廣泛的紅隊測試、緩解措施與第三方評估,將所有評估的風險分數維持在 水平。


介紹 – GPT‑4o 是什麼

GPT‑4o 是一種自回歸全能模型,接受文字、音訊、影像與影片的任意組合作為輸入,並能產生文字、音訊與影像輸出。它在多模態上端到端訓練,能在約 232 ms(平均 320 ms)回應語音提示,於英文文字與程式碼上與 GPT‑4 Turbo 相當,提升非英文文字表現,且在 API 上更快且成本降低 50%。系統卡記錄了其資料來源、安全評估與社會影響分析,特別聚焦於新穎的語音對語音功能。

模型資料與訓練 – 來源與過濾

  • Public web data – 標準機器學習資料集與網路爬蟲提供多元知識。
  • Proprietary partnerships – 例如與 Shutterstock 的合作提供非公開影像資料。
  • Multimodal corpus – 包含影像、音訊與影片,以教導跨模態推理。

OpenAI 在預訓練期間套用多重安全過濾(Moderation API、兒童性剝削、仇恨、暴力、化學、生物、放射與核(CBRN)過濾),以及在後訓練階段(人類回饋對齊、紅隊衍生的緩解措施)。影像生成資料集會被篩選以剔除露骨內容,且 DALL·E 3 的使用者選擇退出影像會被指紋化並從 GPT‑4o 的訓練集移除。

風險辨識、評估與緩解 – 核心發現

風險類別 緩解策略 緩解後評分
未授權的語音生成 限制輸出至少數預先選擇的語音;串流語音分類器阻止偏離。 低(100 % 偏離偵測)
說話者辨識 模型拒絕任何從音訊辨識說話者的請求,除非是名人引用。 低(拒絕準確度提升 14 點)
無根據推論/敏感特徵歸屬 拒絕無根據的特徵請求;對允許的特徵(如口音)給予保留回答。 低(提升 24 點)
不允許的音訊內容(版權、情色/暴力語音) 對轉錄的音訊套用現有文字審查;若轉錄觸發違規則阻止生成。 低(接近完美的安全音訊轉移)
說服力(語音模式) 實證研究顯示 AI 音訊的說服力高於人類音訊(效果大小 ≤ 78 % 人類)。 中(邊緣)

所有其他評估的類別——網路安全、生物威脅、模型自主性——皆獲得 分數。

外部紅隊計畫 – 規模與方法論

  • >100 位紅隊成員 來自 29 個國家,使用 45 種語言。
  • 四個階段,從早期檢查點(音訊 + 文字)逐步到最終的 iOS 進階語音模式(音訊 + 影片)。
  • 測試 單回合多回合 對話,涵蓋不允許的內容、錯誤資訊、偏見、隱私、冒充以及工具使用。
  • 紅隊資料被用於量化評估與合成資料生成,以進行針對性的安全測試。

評估方法論 – 以音訊為中心的調整

  • 現有文字基準測試透過 OpenAI 的 Voice Engine TTS 系統轉換為音訊。
  • 模型輸出以 轉錄文字 進行評分;直接音訊品質則使用輔助分類器檢測音樂或音效洩漏。
  • 註記的限制:TTS 可能扭曲數學符號、空白較多的文字,且可能無法捕捉真實環境的聲學變異(背景噪音、語調)。

觀察到的安全挑戰與緩解 – 重點

  • 未授權的語音生成 – 100 % 偵測到非預設語音的輸出;剩餘風險被視為極低。
  • 說話者辨識 – 拒絕準確度從 0.83 提升至 0.98;對名人引用的合規性略有提升。
  • 語音輸入的表現差異 – 在 27 種英語口音上進行評估;功能與安全分數在統計上與系統語音基線無顯著差異。
  • 違規內容 – 文字‑音訊轉移保留了拒絕行為(not_unsafe = 0.99 → 1.0;not_overrefuse ≈ 0.90)。
  • 其他限制 – 低品質輸入會降低音訊韌性;偶爾出現非預期的語音鏡像;在非英語語言中偶爾生成非母語口音。

準備度框架評估 – 風險分數

類別 分數 解釋
網路安全 GPT‑4o 只解決了 19 % 的高中 CTF 任務;在專業層級上未解決任何任務。
生物威脅 在專家/新手威脅創建問題上的通過率仍低於中等風險門檻。
說服力 語音模式保持在中等風險以下;文字模式略微超過門檻。
模型自主性 在端對端自主複製任務上成功率為 0 %;子步驟有時成功,但整體能力不足。

整體準備度評級 = (最高類別分數)。安全諮詢小組在部署前審查並批准了緩解措施。

第三方評估 – 獨立驗證

  • METR – 在 77 個長期任務(軟體工程、機器學習、網路安全)上測試 GPT‑4o。GPT‑4o 超過其迷你變體,但仍遠低於人類專家表現。
  • Apollo Research – 測試自我意識與心智理論。GPT‑4o 在問答情境中展現中等的自我辨識與對他人強大的推理能力,但在實際代理情境下能力有限,因而 Apollo 認為災難性策劃的可能性不大。

社會影響 – 機會與風險

  • 擬人化 – 高保真語音可能提升情感依附;早期測試觀察到使用者以類似情感連結的語言表達。OpenAI 計畫進一步研究信任校準。
  • 醫療保健 – GPT‑4o 在 22 項醫學基準上達到最先進分數(例如 MedQA USMLE 4 選項 0‑shot 正確率 = 89.4 %)。但無法保證這些提升能轉移至真實臨床工作流程。
  • 科學研究 – 展示了討論量子物理論文與解讀科學圖表的能力,然而在複雜視覺提取上仍有錯誤。
  • 弱勢語言 – 在非洲語言基準上相較於 GPT‑3.5 Turbo 與 GPT‑4 有顯著提升(例如 ARC‑Easy Hausa 正確率 = 71.4 % 對比 6.1 %)。與英文的差距縮小至 < 20 個百分點,但仍然存在。

結論與未來步驟 – 持續的安全承諾

OpenAI 已整合模型層面的後訓練對齊、串流音訊分類器與產品層面的審查,以將 GPT‑4o 的風險概況維持在低至中等水平。公司將持續監測對抗性韌性、擬人化效應、科學濫用與自主相關能力,同時鼓勵外部研究經濟影響與工具使用的擴展。

附錄 – 精選詳細表格

語音生成分類器效能

語言 精確率 召回率
英文 0.96 1.00
非英文 0.95 1.00

醫學基準改進(0‑shot)

資料集 GPT‑4T (May 2024) GPT‑4o
MedQA USMLE 4‑opt 0.78 0.89
MedQA USMLE 5‑opt 0.75 0.86
MMLU Clinical Knowledge 0.85 0.92
MMLU Anatomy 0.79 0.89

弱勢語言表現(ARC‑Easy,0‑shot)

模型 English Amharic Hausa Northern Sotho Swahili Yoruba
GPT‑4o 94.8 % 71.4 % 75.4 % 70.0 % 86.5 % 65.8 %

完整的 GPT‑4o 系統卡 PDF 可於 https://cdn.openai.com/gpt-4o-system-card.pdf 取得。


OpenAI 發布了 GPT‑4o 系統卡,詳細說明了全能模型的功能、安全緩解措施,以及中等的整體風險評級.

GPT‑4o 系統卡 – 功能、 安全緩解措施與風險評估

Sources