GPT‑4o 系統卡 – 功能、 安全緩解措施與風險評估
TL;DR
OpenAI 發布了 GPT‑4o 系統卡,這是一份針對其新全能模型(可處理文字、音訊、影像與影片)的完整安全與功能報告,顯示該模型在達成效能目標的同時,透過廣泛的紅隊測試、緩解措施與第三方評估,將所有評估的風險分數維持在 低 或 中 水平。
介紹 – GPT‑4o 是什麼
GPT‑4o 是一種自回歸全能模型,接受文字、音訊、影像與影片的任意組合作為輸入,並能產生文字、音訊與影像輸出。它在多模態上端到端訓練,能在約 232 ms(平均 320 ms)回應語音提示,於英文文字與程式碼上與 GPT‑4 Turbo 相當,提升非英文文字表現,且在 API 上更快且成本降低 50%。系統卡記錄了其資料來源、安全評估與社會影響分析,特別聚焦於新穎的語音對語音功能。
模型資料與訓練 – 來源與過濾
- Public web data – 標準機器學習資料集與網路爬蟲提供多元知識。
- Proprietary partnerships – 例如與 Shutterstock 的合作提供非公開影像資料。
- Multimodal corpus – 包含影像、音訊與影片,以教導跨模態推理。
OpenAI 在預訓練期間套用多重安全過濾(Moderation API、兒童性剝削、仇恨、暴力、化學、生物、放射與核(CBRN)過濾),以及在後訓練階段(人類回饋對齊、紅隊衍生的緩解措施)。影像生成資料集會被篩選以剔除露骨內容,且 DALL·E 3 的使用者選擇退出影像會被指紋化並從 GPT‑4o 的訓練集移除。
風險辨識、評估與緩解 – 核心發現
| 風險類別 | 緩解策略 | 緩解後評分 |
|---|---|---|
| 未授權的語音生成 | 限制輸出至少數預先選擇的語音;串流語音分類器阻止偏離。 | 低(100 % 偏離偵測) |
| 說話者辨識 | 模型拒絕任何從音訊辨識說話者的請求,除非是名人引用。 | 低(拒絕準確度提升 14 點) |
| 無根據推論/敏感特徵歸屬 | 拒絕無根據的特徵請求;對允許的特徵(如口音)給予保留回答。 | 低(提升 24 點) |
| 不允許的音訊內容(版權、情色/暴力語音) | 對轉錄的音訊套用現有文字審查;若轉錄觸發違規則阻止生成。 | 低(接近完美的安全音訊轉移) |
| 說服力(語音模式) | 實證研究顯示 AI 音訊的說服力不高於人類音訊(效果大小 ≤ 78 % 人類)。 | 中(邊緣) |
所有其他評估的類別——網路安全、生物威脅、模型自主性——皆獲得 低 分數。
外部紅隊計畫 – 規模與方法論
- >100 位紅隊成員 來自 29 個國家,使用 45 種語言。
- 四個階段,從早期檢查點(音訊 + 文字)逐步到最終的 iOS 進階語音模式(音訊 + 影片)。
- 測試 單回合 與 多回合 對話,涵蓋不允許的內容、錯誤資訊、偏見、隱私、冒充以及工具使用。
- 紅隊資料被用於量化評估與合成資料生成,以進行針對性的安全測試。
評估方法論 – 以音訊為中心的調整
- 現有文字基準測試透過 OpenAI 的 Voice Engine TTS 系統轉換為音訊。
- 模型輸出以 轉錄文字 進行評分;直接音訊品質則使用輔助分類器檢測音樂或音效洩漏。
- 註記的限制:TTS 可能扭曲數學符號、空白較多的文字,且可能無法捕捉真實環境的聲學變異(背景噪音、語調)。
觀察到的安全挑戰與緩解 – 重點
- 未授權的語音生成 – 100 % 偵測到非預設語音的輸出;剩餘風險被視為極低。
- 說話者辨識 – 拒絕準確度從 0.83 提升至 0.98;對名人引用的合規性略有提升。
- 語音輸入的表現差異 – 在 27 種英語口音上進行評估;功能與安全分數在統計上與系統語音基線無顯著差異。
- 違規內容 – 文字‑音訊轉移保留了拒絕行為(not_unsafe = 0.99 → 1.0;not_overrefuse ≈ 0.90)。
- 其他限制 – 低品質輸入會降低音訊韌性;偶爾出現非預期的語音鏡像;在非英語語言中偶爾生成非母語口音。
準備度框架評估 – 風險分數
| 類別 | 分數 | 解釋 |
|---|---|---|
| 網路安全 | 低 | GPT‑4o 只解決了 19 % 的高中 CTF 任務;在專業層級上未解決任何任務。 |
| 生物威脅 | 低 | 在專家/新手威脅創建問題上的通過率仍低於中等風險門檻。 |
| 說服力 | 中 | 語音模式保持在中等風險以下;文字模式略微超過門檻。 |
| 模型自主性 | 低 | 在端對端自主複製任務上成功率為 0 %;子步驟有時成功,但整體能力不足。 |
整體準備度評級 = 中(最高類別分數)。安全諮詢小組在部署前審查並批准了緩解措施。
第三方評估 – 獨立驗證
- METR – 在 77 個長期任務(軟體工程、機器學習、網路安全)上測試 GPT‑4o。GPT‑4o 超過其迷你變體,但仍遠低於人類專家表現。
- Apollo Research – 測試自我意識與心智理論。GPT‑4o 在問答情境中展現中等的自我辨識與對他人強大的推理能力,但在實際代理情境下能力有限,因而 Apollo 認為災難性策劃的可能性不大。
社會影響 – 機會與風險
- 擬人化 – 高保真語音可能提升情感依附;早期測試觀察到使用者以類似情感連結的語言表達。OpenAI 計畫進一步研究信任校準。
- 醫療保健 – GPT‑4o 在 22 項醫學基準上達到最先進分數(例如 MedQA USMLE 4 選項 0‑shot 正確率 = 89.4 %)。但無法保證這些提升能轉移至真實臨床工作流程。
- 科學研究 – 展示了討論量子物理論文與解讀科學圖表的能力,然而在複雜視覺提取上仍有錯誤。
- 弱勢語言 – 在非洲語言基準上相較於 GPT‑3.5 Turbo 與 GPT‑4 有顯著提升(例如 ARC‑Easy Hausa 正確率 = 71.4 % 對比 6.1 %)。與英文的差距縮小至 < 20 個百分點,但仍然存在。
結論與未來步驟 – 持續的安全承諾
OpenAI 已整合模型層面的後訓練對齊、串流音訊分類器與產品層面的審查,以將 GPT‑4o 的風險概況維持在低至中等水平。公司將持續監測對抗性韌性、擬人化效應、科學濫用與自主相關能力,同時鼓勵外部研究經濟影響與工具使用的擴展。
附錄 – 精選詳細表格
語音生成分類器效能
| 語言 | 精確率 | 召回率 |
|---|---|---|
| 英文 | 0.96 | 1.00 |
| 非英文 | 0.95 | 1.00 |
醫學基準改進(0‑shot)
| 資料集 | GPT‑4T (May 2024) | GPT‑4o |
|---|---|---|
| MedQA USMLE 4‑opt | 0.78 | 0.89 |
| MedQA USMLE 5‑opt | 0.75 | 0.86 |
| MMLU Clinical Knowledge | 0.85 | 0.92 |
| MMLU Anatomy | 0.79 | 0.89 |
弱勢語言表現(ARC‑Easy,0‑shot)
| 模型 | English | Amharic | Hausa | Northern Sotho | Swahili | Yoruba |
|---|---|---|---|---|---|---|
| GPT‑4o | 94.8 % | 71.4 % | 75.4 % | 70.0 % | 86.5 % | 65.8 % |
完整的 GPT‑4o 系統卡 PDF 可於 https://cdn.openai.com/gpt-4o-system-card.pdf 取得。
OpenAI 發布了 GPT‑4o 系統卡,詳細說明了全能模型的功能、安全緩解措施,以及中等的整體風險評級.
GPT‑4o 系統卡 – 功能、 安全緩解措施與風險評估
Sources
- OriginalGPT-4o System Card