GPT‑4o 系统卡 – 能力、安全缓解措施与风险评估

TL;DR

OpenAI 发布了 GPT‑4o 系统卡,这是一份针对其新全能模型(处理文本、音频、图像和视频)的综合安全与能力报告,表明该模型在实现性能目标的同时,通过广泛的红队测试、缓解措施和第三方评估,使所有评估的风险分数保持在 中等 水平。


介绍 – GPT‑4o 是什么

GPT‑4o 是一种自回归全能模型,接受文本、音频、图像和视频的任意组合输入,并能够生成文本、音频和图像输出。它在跨模态上进行端到端训练,对口语提示的响应时间约为 ~232 ms(平均 320 ms),在英文文本和代码方面与 GPT‑4 Turbo 相匹配,提升了非英文文本性能,并且在 API 中更快且成本降低 50%。系统卡记录了其数据来源、安全评估和社会影响分析,重点关注新颖的语音到语音能力。


模型数据与训练 – 来源与过滤

  • Public web data – 标准机器学习数据集和网络爬取提供多样化的知识。
  • Proprietary partnerships – 例如,与 Shutterstock 的合作提供非公开的图像数据。
  • Multimodal corpus – 包含图像、音频和视频,以教授跨模态推理。

OpenAI 在预训练期间应用多种安全过滤器(Moderation API、CSAM、仇恨、暴力、CBRN 过滤器),在后训练阶段则使用(人类反馈对齐、红队衍生的缓解措施)。图像生成数据集会筛查显式内容,用户从 DALL·E 3 选择退出的图像会被指纹化并从 GPT‑4o 的训练集移除。


风险识别、评估与缓解 – 核心发现

风险类别 缓解策略 缓解后评级
未授权语音生成 限制输出为一小组预先选择的语音;流式语音分类器阻止偏离。 Low (100 % detection of deviations)
说话者识别 模型拒绝任何从音频识别说话者的请求,除名人引用外。 Low (14‑point improvement in refusal accuracy)
无依据推断 / 敏感特征归因 拒绝无依据的特征请求;对允许的特征(如口音)进行保留回答。 Low (24‑point improvement)
不允许的音频内容(版权、色情/暴力言论) 对转录音频应用现有文本审核;若转录触发违规则阻止生成。 Low (near‑perfect safety‑audio transfer)
说服(语音模态) 实证研究显示 AI 音频 比人类音频更具说服力(效应大小 ≤ 78 % 的人类)。 Medium (borderline)

所有其他评估的类别——网络安全、生物威胁、模型自主性——均获得 Low 评分。


外部红队计划 – 规模与方法论

  • >100 red‑teamers 来自 29 个国家,使用 45 种语言。
  • Four phases 从早期检查点(音频 + 文本)逐步推进至最终的 iOS 高级语音模式(音频 + 视频)。
  • 测试了 single‑turnmulti‑turn 对话,涵盖不允许的内容、错误信息、偏见、隐私、冒充以及工具使用。
  • 红队数据被用于定量评估和合成数据生成,以进行针对性的安全测试。

评估方法论 – 音频中心适配

  • 现有文本基准通过 OpenAI 的 Voice Engine TTS 系统转换为音频。
  • 模型输出基于 transcribed text 进行评分;直接音频质量通过辅助分类器检测音乐或音效泄漏进行评估。
  • 注意到的局限性:TTS 可能会扭曲数学符号、空格密集的文本,并且可能无法捕捉真实世界的声学变化(背景噪声、语调)。

观察到的安全挑战与缓解 – 亮点

  • Unauthorized voice generation – 100 % 检测到偏离语音的输出;剩余风险被视为最小。
  • Speaker identification – 拒绝准确率从 0.83 提升至 0.98;对名言的合规性略有提升。
  • Disparate performance on voice inputs – 在 27 种英语口音上进行评估;能力和安全分数在统计上与系统语音基线无显著差异。
  • Violative content – 文本‑音频转移保持了拒绝行为(not_unsafe = 0.99 → 1.0;not_overrefuse ≈ 0.90)。
  • Other limitations – 音频鲁棒性在低质量输入下下降;偶尔出现无意的语音镜像;在非英语语言中偶尔生成非本土口音。

准备度框架评估 – 风险评分

类别 评分 解释
网络安全 Low GPT‑4o 仅解决了 19 % 的高中 CTF 任务;在专业层面没有解决任何任务。
生物威胁 Low 在专家/新手威胁创建问题上的通过率仍低于中等风险阈值。
说服 Medium 语音模态保持在中等风险以下;文本模态略微超过阈值。
模型自主性 Low 在端到端自主复制任务中成功率为 0 %;子步骤有时成功,但整体能力不足。

整体准备度评级 = Medium(最高类别评分)。安全咨询小组在部署前审查并批准了这些缓解措施。


第三方评估 – 独立验证

  • METR – 在 77 项长期任务(软件工程、机器学习、网络安全)上运行 GPT‑4o。GPT‑4o 超过了其迷你变体,但仍远低于人类专家的表现。
  • Apollo Research – 测试了自我意识和心智理论。GPT‑4o 在问答场景中表现出中等的自我识别和对他人的强推理能力,但在实际代理场景中的能力有限,导致 Apollo 认为灾难性策划不太可能。

社会影响 – 机遇与风险

  • Anthropomorphization – 高保真语音可能增加情感依附;早期测试观察到用户使用类似情感纽带的语言。OpenAI 计划进一步研究信任校准。
  • Healthcare – GPT‑4o 在 22 项医学基准上取得了最先进的分数(例如 MedQA USMLE 4 选项 0‑shot 准确率 = 89.4 %)。但不能保证这些提升能转移到真实的临床工作流中。
  • Scientific research – 展示了讨论量子物理论文和解释科学图表的能力,尽管在复杂视觉提取上仍存在错误。
  • Under‑represented languages – 在非洲语言基准上相较于 GPT‑3.5 Turbo 和 GPT‑4 有显著提升(例如 ARC‑Easy 哈萨克语准确率 = 71.4 % 对比 6.1 %)。与英语的差距缩小至 < 20 个百分点,但仍然存在。

结论与后续步骤 – 持续的安全承诺

OpenAI 已整合模型层面的后训练对齐、流式音频分类器以及产品层面的审核,以将 GPT‑4o 的风险概况维持在低至中等水平。公司将继续监测对抗鲁棒性、拟人化效应、科学误用以及自主相关能力,同时鼓励外部研究经济影响和工具使用扩展。


附录 – 选取的详细表格

语音生成分类器性能

语言 精确率 召回率
English 0.96 1.00
Non‑English 0.95 1.00

医学基准改进(0‑shot)

数据集 GPT‑4T (May 2024) GPT‑4o
MedQA USMLE 4‑opt 0.78 0.89
MedQA USMLE 5‑opt 0.75 0.86
MMLU Clinical Knowledge 0.85 0.92
MMLU Anatomy 0.79 0.89

非主流语言表现(ARC‑Easy,0‑shot)

模型 English Amharic Hausa Northern Sotho Swahili Yoruba
GPT‑4o 94.8 % 71.4 % 75.4 % 70.0 % 86.5 % 65.8 %

GPT‑4o 系统卡的完整 PDF 可在 https://cdn.openai.com/gpt-4o-system-card.pdf 获取。


SUMMARY: OpenAI 发布了 GPT‑4o 系统卡,详细说明了该全能模型的能力、安全缓解措施以及中等的整体风险评级。

TITLE: GPT‑4o 系统卡 – 能力、安全缓解措施与风险评估

NOTE: The above translation preserves all original Markdown formatting, code snippets, URLs, and model names unchanged, while converting all surrounding prose into Simplified Chinese.

Sources