OpenAI GPT-5.1 发布说明

OpenAI 已发布 GPT-5.1,这是一种专为代理和编码工作流设计的模型,旨在平衡高级智能与执行速度。此次更新引入了自适应推理,可根据任务复杂度调整思考时间,还有一个专用于低延迟响应的模式,以及用于直接代码和系统交互的新开发者工具。

自适应推理与效率

GPT-5.1 采用了一种全面改进的训练方法,使其能够根据请求的复杂度动态调整用于“思考”的时间和 token 数量。这使得在简单任务上能够获得更快的响应和更低的 token 成本,同时在复杂问题上不牺牲可靠性。

性能提升

  • 延迟降低: 对于简单查询,例如请求一个 npm 命令,GPT-5.1 可以将响应时间从 10 秒降低到 2 秒。
  • 第三方验证: Balyasny Asset Management 报告称,GPT-5.1 的运行速度比 GPT-5 快 2-3 倍,并且在工具密集型推理任务上使用的 token 数量大约是领先竞争对手的一半。Pace 报告称,他们的代理运行速度提高了 50%,同时准确度超过了 GPT-5。

“无推理”模式

开发者可以将 reasoning_effort 参数设置为 none 来禁用推理。此模式针对对延迟敏感的使用场景进行了优化,相较于 GPT-5 的“最小”推理设置,具有以下几个优势:

  • 能力提升: 在并行工具调用、编码任务、指令遵循以及搜索工具的使用方面表现更佳。
  • 网页搜索: 在 API 平台内支持网页搜索。
  • 实际影响: Sierra 观察到,与 GPT-5 的最小推理相比,低延迟工具调用性能提高了 20%。

延长的提示缓存

为了进一步降低延迟和成本,GPT-5.1 支持延长的提示缓存,保留时间可达 24 小时(通过参数 prompt_cache_retention='24h')。这比之前的限制有了显著提升,有助于实现更流畅的多轮对话和长时间的编码会话。缓存的输入 token 比未缓存的 token 便宜 90%。

增强的编码能力

GPT-5.1 在可控性、代码质量以及工具调用过程中面向用户的更新消息的清晰度方面优于 GPT-5。它专门针对简单编辑进行了优化,以减少“过度思考”,同时在复杂任务上保持高性能。

基准测试与行业反馈

  • SWE-bench 已验证: GPT-5.1 达到 76.3% 的得分,超过了 GPT-5 的 72.8%。
  • 开发者工具: 包括 Cursor、Cognition、Augment Code、Factory 和 Warp 在内的公司合作塑造了该模型的编码特性。Augment Code 表示在多文件项目中观察到更准确的更改和更快的迭代,而 Cline 报告称在其 diff 编辑基准测试中提升了 7%。

新开发者工具

在 Responses API 中引入了两个新工具,以实现更可靠的代理行为:

apply_patch 工具

此工具使模型能够使用结构化的 diff 来创建、更新和删除文件。通过发出补丁操作而不仅仅是建议编辑,该模型能够实现更可靠的、迭代的多步骤编辑工作流,而无需进行 JSON 转义。

Shell 工具

Shell 工具使模型能够提出在本地机器上执行的命令行界面(CLI)命令。这创建了一个计划-执行循环,模型可以在此循环中检查系统、运行实用程序并收集数据以完成任务。

模型可用性及变体

GPT-5.1 和 gpt-5.1-chat-latest 在所有付费 API 层级上均可供开发者使用,其定价和速率限制与 GPT-5 相同。此外,OpenAI 还发布了 gpt-5.1-codexgpt-5.1-codex-mini,它们专门针对类似 Codex 的环境中的长时间运行的代理编码任务进行了优化。

技术评估摘要

评估 GPT-5.1 (high) GPT-5 (high)
SWE-bench Verified 76.3% 72.8%
GPQA Diamond (no tools) 88.1% 85.7%
AIME 2025 (no tools) 94.0% 94.6%
FrontierMath (with Python) 26.7% 26.3%
MMMU 85.4% 84.2%
Tau 2-bench Airline 67.0% 62.6%
Tau 2-bench Telecom 95.6% 96.7%
Tau 2-bench Retail 77.9% 81.1%
BrowseComp Long Context 128k 90.0% 90.0%

Sources