GPT-5 开发者发布说明

OpenAI 已通过其 API 平台发布了 GPT-5,推出了一系列针对编码和复杂代理任务进行优化的新模型家族。GPT-5 在软件工程和工具调用方面树立了新的 SOTA(最先进) 基准,并引入了面向开发者的推理力度和响应冗长度控制。

最先进的编码与前端能力

GPT-5 被设计为能够修复 bug、编辑代码并在复杂代码库中导航的编码协作者。它在关键的软件工程基准上超越了包括 o3 在内的所有前代模型。

  • SWE-bench Verified: GPT-5 获得 74.9% 的得分,超过 o3 的 69.1%。在高推理力度下,它使用了比 o3 少 22% 的输出令牌和 45% 的工具调用。
  • Aider Polyglot: 该模型取得了创纪录的 88% 分数,相比 o3 错误率降低了三分之一。
  • Frontend Development: 在内部测试中,GPT-5 在前端网页开发方面被偏好 70% 的时间,原因是其审美感和代码质量的提升。

包括 Cursor、Windsurf 和 Vercel 在内的早期采用者报告称,GPT-5 是他们使用过的最智能的编码模型,赞扬其易于引导以及在美观前端任务中的高性能。

高级代理智能与工具使用

GPT-5 在执行长期代理任务和链式复杂工具调用而不丢失上下文方面表现出显著提升。

  • Tool Calling Performance: GPT-5 在 τ 2-bench 电信基准上得分 96.7%,相比之前的前沿模型(此前没有模型超过 49%)有大幅提升。
  • Instruction Following: 该模型在 Scale MultiChallenge(由 o3-mini 评分)上得分 69.6%,在 COLLIE 上得分 99%。
  • Long-Context Retrieval: 在 OpenAI-MRCR 基准上,GPT-5 超越 o3 与 GPT-4.1,且在更长输入长度下性能提升更明显。在 BrowseComp 长上下文基准(128K–256K 令牌)上,它 89% 的时间给出正确答案。
  • Context Window: 所有 GPT-5 模型支持最高 272,000 输入令牌以及 128,000 推理和输出令牌,总计 400,000 令牌的上下文长度。

为开发者提供的新 API 功能

OpenAI 引入了多个参数和工具类型,让开发者能够更细粒度地控制模型行为:

  • reasoning_effort 参数: 开发者现在可以在 minimallowmedium(默认)和 high 之间选择。minimal 设置将最小化推理时间,以更快返回答案。
  • verbosity 参数: 新增的参数可取 lowmedium(默认)和 high,用于控制响应的长度。明确的提示指令会覆盖此设置。
  • 自定义工具: GPT-5 现在支持通过纯文本而非 JSON 调用工具。这降低了在长输出中转义控制字符导致的错误。开发者可以使用正则表达式或上下文无关文法约束这些工具。
  • 前置消息: 在指示下,GPT-5 可以在工具调用前后输出可见消息,以向最终用户传达其计划和进度。

真实性与安全性

与前代模型相比,GPT-5 的幻觉显著减少。在 LongFact 与 FactScore 基准上,GPT-5 的事实错误约比 o3 少 80%。该模型还专门针对健康相关问题进行了更高准确度的微调,并提升了对自身局限性的自我认知。

模型可用性与定价

GPT-5 提供三种规模,以帮助开发者在性能、成本和延迟之间取得平衡。它同样可通过 Responses API、Chat Completions API 以及 Codex CLI 的默认模型使用。

模型 输入价格(每 1M 令牌) 输出价格(每 1M 令牌)
gpt-5 $1.25 $10.00
gpt-5-mini $0.25 $2.00
gpt-5-nano $0.05 $0.40

此外,ChatGPT 使用的非推理版本可作为 gpt-5-chat-latest($1.25 输入 / $10.00 输出)获取。GPT-5 还在 Microsoft 平台上部署,包括 Azure AI Foundry、GitHub Copilot 和 Microsoft 365 Copilot。

Sources