OpenAI GPT-5.4 发布:统一推理、编码和计算机使用模型,支持 1M 令牌上下文

TL;DR

OpenAI 发布了 GPT‑5.4,这是其在专业工作中最强大且高效的前沿模型,现已在 ChatGPT(作为 Thinking)、API 和 Codex 中提供,并配备了性能更高的 Pro 变体。该模型新增原生计算机使用、最高 1 M 令牌上下文、更好的工具搜索以及更强的推理、编码和知识工作能力,在广泛基准测试中实现了更高的准确率、更低的令牌使用量和更快的速度。


发布概览

OpenAI 于 2026 年 3 月 5 日宣布推出 GPT‑5.4。该模型在三个产品线中部署:

  • ChatGPT – 作为 GPT‑5.4 Thinking(标准)和 GPT‑5.4 Pro(最高性能)。
  • API – 可通过 gpt-5.4gpt-5.4-pro 端点访问。
  • Codex – 与新的编码聚焦功能集成。

GPT‑5.4 将近期在推理、编码和代理工作流方面的进展统一起来,继承了 GPT‑5.3‑Codex 的编码优势,同时在电子表格、演示文稿、文档和工具丰富的环境中提升了性能。


关键技术改进

统一推理与规划

  • 前置规划 – 在 ChatGPT 中,模型现在会在生成回复之前概述其思考过程,允许用户在回复进行中调整计划。
  • 更长上下文 – 支持最高 1 M 令牌,使代理能够在极长任务中保持连贯性。
  • 降低令牌消耗 – 在相似推理下使用的令牌显著少于 GPT‑5.2,降低成本和延迟。

原生计算机使用

  • 首个具备内置计算机使用能力的通用模型,允许代理通过如 Playwright 等库控制应用程序,并可根据截图发出鼠标/键盘操作。
  • 工具搜索 – 模型无需预先加载所有工具定义,而是可按需检索工具定义,在大型工具密集工作流中将令牌使用量降低约 ≈47 %
  • 工具调用准确性 – 在 Toolathon 和 τ2‑bench 等基准测试中提升多步骤工具使用的准确率,以更少的交互轮次实现更高的准确性。

视觉与感知

  • 引入 original 图像细节级别(最高 10.24 M 像素),并将 high 级别扩展至 2.56 M 像素,提升定位、点击准确性和密集图像理解。
  • 在 MMMU‑Pro(无工具)上达到 81.2 %,使用工具时为 82.1 %,超越 GPT‑5.2。

编码增强

  • 将 GPT‑5.3‑Codex 的编码优势与新的推理和工具能力相结合。
  • Codex 中的 /fast mode 可实现高达 1.5× 的令牌处理速度提升,且不牺牲智能。
  • 引入实验性的 Playwright (Interactive) 技能,用于网页/Electron 应用的可视化调试和自动化测试。

基准性能

Benchmark GPT‑5.4 GPT‑5.3‑Codex GPT‑5.2
GDPval(知识工作) 83.0 % 70.9 %
SWE‑Bench Pro(编码) 57.7 % 55.6 %
OSWorld‑Verified(桌面计算机使用) 75.0 % 74.0 % 47.3 %
WebArena‑Verified(浏览器使用) 67.3 % 65.4 %
BrowseComp(网页搜索) 82.7 % (standard) / 89.3 % (Pro) 77.3 % 65.8 %
MMMU‑Pro(视觉) 81.2 % (no tools) / 82.1 % (with tools) 79.5 %
Toolathlon(工具使用) 54.6 % 45.7 %
Investment‑banking 电子表格任务(内部) 87.3 % 68.4 %
演示质量(人工评估) 68.0 % preferred over GPT‑5.2

所有评估均在推理力度设为 xhigh 的情况下进行,除非另有说明。


实际能力

专业知识工作

  • 在 44 个职业的 GDPval 对比中,匹配或超越行业专业人士的比例达到 83 %
  • 降低事实错误:单个声明出现错误的概率比 GPT‑5.2 低 33 %,完整回复出现任何错误的概率低 18 %
  • 生成更高质量的电子表格、演示文稿和文档,人工评估者更倾向于 GPT‑5.4 的输出,因其美观性和功能多样性。

计算机使用代理

  • 在桌面导航(75 % 对比 GPT‑5.2 的 47 %)以及网页交互基准(在 Online‑Mind2Web 上最高 92.8 %)方面达到了业界领先的成功率。
  • 通过工具搜索和并行工具产出,支持协同多工具工作流并降低延迟。
  • 在房产税门户任务中展示了 95 % 的首次尝试成功率,完成会话的速度提升约 ~3×,且令牌使用量减少约 ~70 %

编码与开发

  • 在 SWE‑Bench Pro 上超越 GPT‑5.3‑Codex,同时提供更低的延迟。
  • Playwright (Interactive) 技能在代码生成期间实现可视化调试和自动化测试,示例为从单一提示构建的完整主题公园模拟。

安全与治理

  • 根据 OpenAI 的准备框架,被归类为 高网络能力,并在零数据保留(ZDR)环境中对高风险请求实施扩展监控、可信访问控制和异步阻断。
  • 引入开源的 CoT 可控性 评估,显示 GPT‑5.4 隐蔽链式思考推理的能力较低,强化了 CoT 监控的有效性。
  • 随着分类器的改进,持续的优化可能导致对 ZDR 客户的偶发误报拒绝。

可用性与定价

  • ChatGPT – GPT‑5.4 Thinking 已对 Plus、Team 和 Pro 用户上线;GPT‑5.4 Pro 可供 Pro 和 Enterprise 计划使用。旧版 GPT‑5.2 Thinking 将保留至 2026 年 6 月 5 日。
  • APIgpt-5.4(标准)和 gpt-5.4-pro(最高性能)已上线。每 M 令牌的定价为:标准版输入 $2.50,缓存输入 $0.25,输出 $15;Pro 变体输入 $30,输出 $180。
  • 上下文窗口 – 默认 272 K 令牌;可通过 model_context_windowmodel_auto_compact_token_limit 启用实验性的 1 M 令牌窗口,超出 272 K 的使用量按正常费率的 2 倍计费。

对开发者和企业的影响

  • 更高生产力 – 模型的规划、更长上下文和高效工具使用降低了完成复杂任务所需的交互轮次数。
  • 成本效率 – 尽管每令牌费用更高,但整体令牌消耗下降,因为 GPT‑5.4 能以更少的令牌解决问题。
  • 更广泛的工具生态系统 – 工具搜索使代理能够使用数千种可能的工具,而不会产生巨大的令牌开销。
  • 提升可靠性 – 更低的幻觉率和更强的安全控制使 GPT‑5.4 适用于法律分析、金融建模和医疗排程等高风险专业领域。

结论

OpenAI 的 GPT‑5.4 代表了前沿 AI 的重要进展,将最先进的推理、编码、视觉和原生计算机使用能力融合于单一模型。其在专业、编码和计算机使用基准测试中的性能提升,加上改进的令牌效率和安全特性,使其成为企业和开发者在复杂真实工作流中寻求高质量、成本效益 AI 助手的有力选择。


来源

SUMMARY: OpenAI 发布了 GPT‑5.4,这是一款具备原生计算机使用、1 M 令牌上下文以及改进的推理、编码和工具能力的统一前沿模型,在专业和代理基准测试中实现了更高的准确率和更低的令牌使用量。

TITLE: OpenAI GPT-5.4 发布:统一推理、编码和计算机使用模型,支持 1M 令牌上下文

Sources