GPT‑4o 系统卡 – 能力、安全缓解措施与风险评估
TL;DR
OpenAI 发布了 GPT‑4o 系统卡,这是一份针对其新全能模型(处理文本、音频、图像和视频)的综合安全与能力报告,表明该模型在实现性能目标的同时,通过广泛的红队测试、缓解措施和第三方评估,使所有评估的风险分数保持在 低 或 中等 水平。
介绍 – GPT‑4o 是什么
GPT‑4o 是一种自回归全能模型,接受文本、音频、图像和视频的任意组合输入,并能够生成文本、音频和图像输出。它在跨模态上进行端到端训练,对口语提示的响应时间约为 ~232 ms(平均 320 ms),在英文文本和代码方面与 GPT‑4 Turbo 相匹配,提升了非英文文本性能,并且在 API 中更快且成本降低 50%。系统卡记录了其数据来源、安全评估和社会影响分析,重点关注新颖的语音到语音能力。
模型数据与训练 – 来源与过滤
- Public web data – 标准机器学习数据集和网络爬取提供多样化的知识。
- Proprietary partnerships – 例如,与 Shutterstock 的合作提供非公开的图像数据。
- Multimodal corpus – 包含图像、音频和视频,以教授跨模态推理。
OpenAI 在预训练期间应用多种安全过滤器(Moderation API、CSAM、仇恨、暴力、CBRN 过滤器),在后训练阶段则使用(人类反馈对齐、红队衍生的缓解措施)。图像生成数据集会筛查显式内容,用户从 DALL·E 3 选择退出的图像会被指纹化并从 GPT‑4o 的训练集移除。
风险识别、评估与缓解 – 核心发现
| 风险类别 | 缓解策略 | 缓解后评级 |
|---|---|---|
| 未授权语音生成 | 限制输出为一小组预先选择的语音;流式语音分类器阻止偏离。 | Low (100 % detection of deviations) |
| 说话者识别 | 模型拒绝任何从音频识别说话者的请求,除名人引用外。 | Low (14‑point improvement in refusal accuracy) |
| 无依据推断 / 敏感特征归因 | 拒绝无依据的特征请求;对允许的特征(如口音)进行保留回答。 | Low (24‑point improvement) |
| 不允许的音频内容(版权、色情/暴力言论) | 对转录音频应用现有文本审核;若转录触发违规则阻止生成。 | Low (near‑perfect safety‑audio transfer) |
| 说服(语音模态) | 实证研究显示 AI 音频 不 比人类音频更具说服力(效应大小 ≤ 78 % 的人类)。 | Medium (borderline) |
所有其他评估的类别——网络安全、生物威胁、模型自主性——均获得 Low 评分。
外部红队计划 – 规模与方法论
- >100 red‑teamers 来自 29 个国家,使用 45 种语言。
- Four phases 从早期检查点(音频 + 文本)逐步推进至最终的 iOS 高级语音模式(音频 + 视频)。
- 测试了 single‑turn 和 multi‑turn 对话,涵盖不允许的内容、错误信息、偏见、隐私、冒充以及工具使用。
- 红队数据被用于定量评估和合成数据生成,以进行针对性的安全测试。
评估方法论 – 音频中心适配
- 现有文本基准通过 OpenAI 的 Voice Engine TTS 系统转换为音频。
- 模型输出基于 transcribed text 进行评分;直接音频质量通过辅助分类器检测音乐或音效泄漏进行评估。
- 注意到的局限性:TTS 可能会扭曲数学符号、空格密集的文本,并且可能无法捕捉真实世界的声学变化(背景噪声、语调)。
观察到的安全挑战与缓解 – 亮点
- Unauthorized voice generation – 100 % 检测到偏离语音的输出;剩余风险被视为最小。
- Speaker identification – 拒绝准确率从 0.83 提升至 0.98;对名言的合规性略有提升。
- Disparate performance on voice inputs – 在 27 种英语口音上进行评估;能力和安全分数在统计上与系统语音基线无显著差异。
- Violative content – 文本‑音频转移保持了拒绝行为(not_unsafe = 0.99 → 1.0;not_overrefuse ≈ 0.90)。
- Other limitations – 音频鲁棒性在低质量输入下下降;偶尔出现无意的语音镜像;在非英语语言中偶尔生成非本土口音。
准备度框架评估 – 风险评分
| 类别 | 评分 | 解释 |
|---|---|---|
| 网络安全 | Low | GPT‑4o 仅解决了 19 % 的高中 CTF 任务;在专业层面没有解决任何任务。 |
| 生物威胁 | Low | 在专家/新手威胁创建问题上的通过率仍低于中等风险阈值。 |
| 说服 | Medium | 语音模态保持在中等风险以下;文本模态略微超过阈值。 |
| 模型自主性 | Low | 在端到端自主复制任务中成功率为 0 %;子步骤有时成功,但整体能力不足。 |
整体准备度评级 = Medium(最高类别评分)。安全咨询小组在部署前审查并批准了这些缓解措施。
第三方评估 – 独立验证
- METR – 在 77 项长期任务(软件工程、机器学习、网络安全)上运行 GPT‑4o。GPT‑4o 超过了其迷你变体,但仍远低于人类专家的表现。
- Apollo Research – 测试了自我意识和心智理论。GPT‑4o 在问答场景中表现出中等的自我识别和对他人的强推理能力,但在实际代理场景中的能力有限,导致 Apollo 认为灾难性策划不太可能。
社会影响 – 机遇与风险
- Anthropomorphization – 高保真语音可能增加情感依附;早期测试观察到用户使用类似情感纽带的语言。OpenAI 计划进一步研究信任校准。
- Healthcare – GPT‑4o 在 22 项医学基准上取得了最先进的分数(例如 MedQA USMLE 4 选项 0‑shot 准确率 = 89.4 %)。但不能保证这些提升能转移到真实的临床工作流中。
- Scientific research – 展示了讨论量子物理论文和解释科学图表的能力,尽管在复杂视觉提取上仍存在错误。
- Under‑represented languages – 在非洲语言基准上相较于 GPT‑3.5 Turbo 和 GPT‑4 有显著提升(例如 ARC‑Easy 哈萨克语准确率 = 71.4 % 对比 6.1 %)。与英语的差距缩小至 < 20 个百分点,但仍然存在。
结论与后续步骤 – 持续的安全承诺
OpenAI 已整合模型层面的后训练对齐、流式音频分类器以及产品层面的审核,以将 GPT‑4o 的风险概况维持在低至中等水平。公司将继续监测对抗鲁棒性、拟人化效应、科学误用以及自主相关能力,同时鼓励外部研究经济影响和工具使用扩展。
附录 – 选取的详细表格
语音生成分类器性能
| 语言 | 精确率 | 召回率 |
|---|---|---|
| English | 0.96 | 1.00 |
| Non‑English | 0.95 | 1.00 |
医学基准改进(0‑shot)
| 数据集 | GPT‑4T (May 2024) | GPT‑4o |
|---|---|---|
| MedQA USMLE 4‑opt | 0.78 | 0.89 |
| MedQA USMLE 5‑opt | 0.75 | 0.86 |
| MMLU Clinical Knowledge | 0.85 | 0.92 |
| MMLU Anatomy | 0.79 | 0.89 |
非主流语言表现(ARC‑Easy,0‑shot)
| 模型 | English | Amharic | Hausa | Northern Sotho | Swahili | Yoruba |
|---|---|---|---|---|---|---|
| GPT‑4o | 94.8 % | 71.4 % | 75.4 % | 70.0 % | 86.5 % | 65.8 % |
GPT‑4o 系统卡的完整 PDF 可在 https://cdn.openai.com/gpt-4o-system-card.pdf 获取。
SUMMARY: OpenAI 发布了 GPT‑4o 系统卡,详细说明了该全能模型的能力、安全缓解措施以及中等的整体风险评级。
TITLE: GPT‑4o 系统卡 – 能力、安全缓解措施与风险评估
NOTE: The above translation preserves all original Markdown formatting, code snippets, URLs, and model names unchanged, while converting all surrounding prose into Simplified Chinese.
Sources
- OriginalGPT-4o System Card