OpenAI GPT-5.5 发布说明
OpenAI 已发布 GPT-5.5 和 GPT-5.5 Pro,标志着向具备规划和执行跨多种软件工具的多步骤任务的代理式 AI 转变。这些模型在编码和知识工作中提供了更高的智能和改进的 token 效率,同时相较于 GPT-5.4 并未增加每 token 的延迟。
代理式编码与软件工程
GPT-5.5 被设计为高自治的编码模型,能够管理复杂的、长期的工程任务。它在理解系统架构、推理模糊故障以及在大型代码库中保持上下文方面表现出更强的能力。
性能基准
- Terminal-Bench 2.0: 在复杂的命令行工作流中实现了 82.7% 的准确率。
- SWE-Bench Pro: 在解决真实的 GitHub 问题上达到 58.6%。
- Expert-SWE (Internal): 在中位人工完成时间为 20 小时的任务上超越了 GPT-5.4。
实际应用
早期测试者报告了概念清晰度的跨越式提升。例如,模型成功在 20 分钟内完成了涉及数百个前端和重构更改的复杂分支合并。来自 NVIDIA 和 Cursor 的用户指出,它的坚持性以及在未明确提示的情况下预测测试和审查需求的能力。
知识工作与计算机使用
GPT-5.5 更好地结合了意图理解与计算机使用能力,使其能够在界面间导航、点击、输入并在工具之间移动,以完成知识工作循环。
专业基准
- GDPval: 在 44 种职业中产生规范化知识工作的得分为 84.9%。
- OSWorld-Verified: 在自主操作真实计算机环境方面达到 78.7%。
- Tau2-bench Telecom: 在无需提示调优的复杂客服工作流中实现了 98.0%。
内部部署
OpenAI 报告称,超过 85% 的员工每周使用 Codex。使用案例包括财务团队审阅超过 71,000 页的 K-1 税表(将任务加速了两周)以及通讯团队通过 Slack 代理自动化低风险的发言请求处理。
科学研究与数学发现
GPT-5.5 充当“共同科学家”,在探索想法、收集证据和解释结果的迭代循环中保持持续性。
技术成就
- 数学证明: GPT-5.5 的内部版本发现了组合数学中关于对角线外 Ramsey 数的新证明,随后在 Lean 中得到验证。
- 生物信息学: 模型在 BixBench 上取得领先表现,并在 GeneBench 上相较于 GPT-5.4 有显著提升,特别是在遗传学的多阶段科学数据分析中。
- 自定义工具: 研究人员使用模型在几分钟内从单个提示构建复杂的代数几何应用,可视化二次曲面交叉。
推理效率与基础设施
GPT-5.5 与 NVIDIA GB200 和 GB300 NVL72 系统共同设计并训练。为保持 GPT-5.4 的延迟水平,OpenAI 使用模型本身优化了推理栈。
Codex 被用于分析生产流量模式并编写自定义启发式算法以进行负载均衡和分区。此优化将 token 生成速度提升了超过 20%。
网络安全与安全框架
OpenAI 在其准备框架下将 GPT-5.5 的生物、化学和网络安全能力归类为“高”,但未达到网络安全的“关键”级别。
安全措施
- 更严格的分类器: 部署包括对高风险活动和敏感网络请求的更紧控制。
- 网络可信访问: 经验证的用户和组织可申请“网络宽容”模型(如 GPT-5.4-Cyber),以降低合法防御工作中的摩擦。
- 治理: 模型经过完整的安全处理,包括红队演练和针对高级生物学与网络安全的定向测试。
可用性与定价
访问方式
- ChatGPT: GPT-5.5 对 Plus、Pro、Business 和 Enterprise 用户开放。GPT-5.5 Pro 对 Pro、Business 和 Enterprise 用户开放。
- Codex: 对 Plus、Pro、Business、Enterprise、Edu 和 Go 计划提供,拥有 400K 上下文窗口。
- API: GPT-5.5 和 GPT-5.5 Pro 已在 API 中提供(截至 2026 年 4 月 24 日)。
API 定价
| 模型 | 输入(每 1M token) | 输出(每 1M token) | 上下文窗口 |
|---|---|---|---|
| gpt-5.5 | $5 | $30 | 1M |
| gpt-5.5-pro | $30 | $180 | 1M |
批量和弹性定价为标准费率的 50%,优先处理为标准费率的 2.5 倍。
Sources
- OriginalIntroducing GPT-5.5