OpenAI GPT-5.4 发布:统一推理、编码和计算机使用模型,支持 1M 令牌上下文
TL;DR
OpenAI 发布了 GPT‑5.4,这是其在专业工作中最强大且高效的前沿模型,现已在 ChatGPT(作为 Thinking)、API 和 Codex 中提供,并配备了性能更高的 Pro 变体。该模型新增原生计算机使用、最高 1 M 令牌上下文、更好的工具搜索以及更强的推理、编码和知识工作能力,在广泛基准测试中实现了更高的准确率、更低的令牌使用量和更快的速度。
发布概览
OpenAI 于 2026 年 3 月 5 日宣布推出 GPT‑5.4。该模型在三个产品线中部署:
- ChatGPT – 作为 GPT‑5.4 Thinking(标准)和 GPT‑5.4 Pro(最高性能)。
- API – 可通过
gpt-5.4和gpt-5.4-pro端点访问。 - Codex – 与新的编码聚焦功能集成。
GPT‑5.4 将近期在推理、编码和代理工作流方面的进展统一起来,继承了 GPT‑5.3‑Codex 的编码优势,同时在电子表格、演示文稿、文档和工具丰富的环境中提升了性能。
关键技术改进
统一推理与规划
- 前置规划 – 在 ChatGPT 中,模型现在会在生成回复之前概述其思考过程,允许用户在回复进行中调整计划。
- 更长上下文 – 支持最高 1 M 令牌,使代理能够在极长任务中保持连贯性。
- 降低令牌消耗 – 在相似推理下使用的令牌显著少于 GPT‑5.2,降低成本和延迟。
原生计算机使用
- 首个具备内置计算机使用能力的通用模型,允许代理通过如 Playwright 等库控制应用程序,并可根据截图发出鼠标/键盘操作。
- 工具搜索 – 模型无需预先加载所有工具定义,而是可按需检索工具定义,在大型工具密集工作流中将令牌使用量降低约 ≈47 %。
- 工具调用准确性 – 在 Toolathon 和 τ2‑bench 等基准测试中提升多步骤工具使用的准确率,以更少的交互轮次实现更高的准确性。
视觉与感知
- 引入
original图像细节级别(最高 10.24 M 像素),并将high级别扩展至 2.56 M 像素,提升定位、点击准确性和密集图像理解。 - 在 MMMU‑Pro(无工具)上达到 81.2 %,使用工具时为 82.1 %,超越 GPT‑5.2。
编码增强
- 将 GPT‑5.3‑Codex 的编码优势与新的推理和工具能力相结合。
- Codex 中的 /fast mode 可实现高达 1.5× 的令牌处理速度提升,且不牺牲智能。
- 引入实验性的 Playwright (Interactive) 技能,用于网页/Electron 应用的可视化调试和自动化测试。
基准性能
| Benchmark | GPT‑5.4 | GPT‑5.3‑Codex | GPT‑5.2 |
|---|---|---|---|
| GDPval(知识工作) | 83.0 % | – | 70.9 % |
| SWE‑Bench Pro(编码) | 57.7 % | – | 55.6 % |
| OSWorld‑Verified(桌面计算机使用) | 75.0 % | 74.0 % | 47.3 % |
| WebArena‑Verified(浏览器使用) | 67.3 % | – | 65.4 % |
| BrowseComp(网页搜索) | 82.7 % (standard) / 89.3 % (Pro) | 77.3 % | 65.8 % |
| MMMU‑Pro(视觉) | 81.2 % (no tools) / 82.1 % (with tools) | – | 79.5 % |
| Toolathlon(工具使用) | 54.6 % | – | 45.7 % |
| Investment‑banking 电子表格任务(内部) | 87.3 % | – | 68.4 % |
| 演示质量(人工评估) | 68.0 % preferred over GPT‑5.2 |
所有评估均在推理力度设为 xhigh 的情况下进行,除非另有说明。
实际能力
专业知识工作
- 在 44 个职业的 GDPval 对比中,匹配或超越行业专业人士的比例达到 83 %。
- 降低事实错误:单个声明出现错误的概率比 GPT‑5.2 低 33 %,完整回复出现任何错误的概率低 18 %。
- 生成更高质量的电子表格、演示文稿和文档,人工评估者更倾向于 GPT‑5.4 的输出,因其美观性和功能多样性。
计算机使用代理
- 在桌面导航(75 % 对比 GPT‑5.2 的 47 %)以及网页交互基准(在 Online‑Mind2Web 上最高 92.8 %)方面达到了业界领先的成功率。
- 通过工具搜索和并行工具产出,支持协同多工具工作流并降低延迟。
- 在房产税门户任务中展示了 95 % 的首次尝试成功率,完成会话的速度提升约 ~3×,且令牌使用量减少约 ~70 %。
编码与开发
- 在 SWE‑Bench Pro 上超越 GPT‑5.3‑Codex,同时提供更低的延迟。
- Playwright (Interactive) 技能在代码生成期间实现可视化调试和自动化测试,示例为从单一提示构建的完整主题公园模拟。
安全与治理
- 根据 OpenAI 的准备框架,被归类为 高网络能力,并在零数据保留(ZDR)环境中对高风险请求实施扩展监控、可信访问控制和异步阻断。
- 引入开源的 CoT 可控性 评估,显示 GPT‑5.4 隐蔽链式思考推理的能力较低,强化了 CoT 监控的有效性。
- 随着分类器的改进,持续的优化可能导致对 ZDR 客户的偶发误报拒绝。
可用性与定价
- ChatGPT – GPT‑5.4 Thinking 已对 Plus、Team 和 Pro 用户上线;GPT‑5.4 Pro 可供 Pro 和 Enterprise 计划使用。旧版 GPT‑5.2 Thinking 将保留至 2026 年 6 月 5 日。
- API –
gpt-5.4(标准)和gpt-5.4-pro(最高性能)已上线。每 M 令牌的定价为:标准版输入 $2.50,缓存输入 $0.25,输出 $15;Pro 变体输入 $30,输出 $180。 - 上下文窗口 – 默认 272 K 令牌;可通过
model_context_window和model_auto_compact_token_limit启用实验性的 1 M 令牌窗口,超出 272 K 的使用量按正常费率的 2 倍计费。
对开发者和企业的影响
- 更高生产力 – 模型的规划、更长上下文和高效工具使用降低了完成复杂任务所需的交互轮次数。
- 成本效率 – 尽管每令牌费用更高,但整体令牌消耗下降,因为 GPT‑5.4 能以更少的令牌解决问题。
- 更广泛的工具生态系统 – 工具搜索使代理能够使用数千种可能的工具,而不会产生巨大的令牌开销。
- 提升可靠性 – 更低的幻觉率和更强的安全控制使 GPT‑5.4 适用于法律分析、金融建模和医疗排程等高风险专业领域。
结论
OpenAI 的 GPT‑5.4 代表了前沿 AI 的重要进展,将最先进的推理、编码、视觉和原生计算机使用能力融合于单一模型。其在专业、编码和计算机使用基准测试中的性能提升,加上改进的令牌效率和安全特性,使其成为企业和开发者在复杂真实工作流中寻求高质量、成本效益 AI 助手的有力选择。
来源
- OpenAI 博客文章 – Introducing GPT‑5.4(2026‑03‑05) – https://openai.com/index/introducing-gpt-5-4
SUMMARY: OpenAI 发布了 GPT‑5.4,这是一款具备原生计算机使用、1 M 令牌上下文以及改进的推理、编码和工具能力的统一前沿模型,在专业和代理基准测试中实现了更高的准确率和更低的令牌使用量。
TITLE: OpenAI GPT-5.4 发布:统一推理、编码和计算机使用模型,支持 1M 令牌上下文
Sources
- OriginalIntroducing GPT-5.4