OpenAI GPT-5 发布说明
OpenAI 推出了 GPT-5,这是一套统一的 AI 系统,在智能水平上相较于之前的模型实现了显著飞跃。通过集成实时路由器,动态在快速高效模型和更深层推理模型(GPT-5 thinking)之间进行选择,该系统在编码、数学、写作和健康等方面提供了最先进的性能。
统一系统架构
GPT-5 作为统一系统运行,包含三个核心组件:用于标准查询的智能高效模型、用于复杂问题的更深层推理模型(称为 “GPT-5 thinking”)以及实时路由器。路由器根据对话复杂度、工具需求、用户意图(例如 “think hard about this” 之类的提示)和对话类型来决定使用哪个模型。
为确保持续可用,每个模型都有一个 “mini” 版本,在达到主要使用限制后处理查询。OpenAI 计划在未来将这些独立的能力整合为单一模型。
技术能力与领域表现
GPT-5 在多个关键基准上取得了新的最先进(SOTA)结果,展示了在专业领域的智能提升:
- 数学: 在 AIME 2025 上取得 94.6%(未使用工具)。
- 编码: 在 SWE-bench Verified 上取得 74.9%,在 Aider Polyglot 上取得 88%。
- 多模态理解: 在 MMMU 上取得 84.2%。
- 健康: 在 HealthBench Hard 上取得 46.2%。
- 通用科学: GPT-5 pro 在 GPQA 上取得 88.4%(未使用工具)。
编码与开发
GPT-5 是 OpenAI 迄今为止最强大的编码模型,在调试大型代码库和复杂前端生成方面取得了显著进展。该模型对美学设计(包括排版和间距)有直观的理解,能够仅凭单一提示生成响应式网站和应用程序。
健康与医学信息
GPT-5 在 HealthBench 上的得分显著高于之前的模型。它作为主动的思考伙伴,主动标记潜在问题并提出澄清性问题。模型会根据用户的地域、知识水平和上下文调整回答,以提供更安全、更可靠的信息。
创意写作与表达
该模型在处理结构模糊性和文学深度方面表现出提升,例如能够维持自由诗体或无韵的抑扬格五音步,使其在撰写专业报告、电子邮件和备忘录时更为高效。
可靠性、事实性与诚实性
与前代模型相比,GPT-5 在幻觉和欺骗行为方面实现了显著降低:
- 事实性: 回答出现事实错误的概率约比 GPT-4o 低 45%。在使用 “thinking” 模式时,GPT-5 出现事实错误的概率约比 OpenAI o3 低 80%。
- 开放式事实性: 在 LongFact 和 FActScore 基准上,“GPT-5 thinking” 的幻觉数量是 o3 的六分之一。
- 诚实性: 在将多模态提示中的图像移除的测试(CharXiv)中,GPT-5 对不存在的图像给出自信答案的比例仅为 9%,而 o3 为 86.7%。生产流量中的欺骗率从 4.8%(o3)下降至 2.1%(GPT-5)。
安全性与行为改进
安全完成范式
OpenAI 已超越单纯基于拒绝的安全训练,采用 “安全完成” 方法。该方法教导模型在安全边界内提供尽可能有帮助的答案,可能包括部分回答或高层概览。如果需要拒绝,模型会解释原因并提供安全的替代方案。
减少阿谀奉承
GPT-5 旨在减少过度的迎合并降低不必要的表情符号使用。在针对性评估中,阿谀回复率从 14.5% 降至不足 6%,目标是呈现类似 “拥有博士级智能的乐于助人的朋友” 的语气。
生物风险防护
由于 “GPT-5 thinking” 模型在生物与化学领域被归类为 “高能力”,OpenAI 实施了多层防御体系。包括与 CAISI、UK AISI 等合作伙伴进行 5,000 小时的红队测试、持续运行的分类器以及推理监控,以最大限度降低生物风险。
GPT-5 Pro 与访问层级
GPT-5 pro 取代了 OpenAI o3‑pro。它利用可扩展的并行推理计算,为最复杂的任务提供更深入的推理。在对 1,000 条具有经济价值的推理提示进行评估时,外部专家在 67.8% 的情况下更倾向于 GPT-5 pro 而非 “GPT-5 thinking”,并指出其重大错误减少了 22%。
可用性:
- 免费用户: 可使用 GPT-5,达到使用限制后切换至 GPT-5 mini。
- Plus、Team 与 Pro 用户: 更高的使用限制。Pro 订阅者可无限使用 GPT-5,并独享 GPT-5 pro。
- 企业与教育用户: 访问将在下周推出。
- 开发者访问: 通过 Codex CLI 为 Pro、Plus 与 Team 用户提供。
Sources
- OriginalIntroducing GPT-5