GPT-5.6 Sol、Terra、Luna:性能、特性与可用性
GPT-5.6 Sol、Terra、Luna:性能、特性与可用性
TL;DR
OpenAI 发布了 GPT‑5.6 系列——Sol 为旗舰模型,Terra 为均衡模型,Luna 为最具成本效益的模型——实现了更高的每标记智能水平,新增的 ultra 设置可并行运行多个代理,并配备迄今为止最强大的安全系统。
模型系列概览
GPT‑5.6 包含三个层级:Sol、Terra 和 Luna。Sol 是面向高强度工作的旗舰模型,Terra 为日常任务提供均衡性能,Luna 则提供最快、最低成本的选项。三者共享相同的代号,而层级名称表示可独立演进的持久能力水平。
性能与效率提升
GPT‑5.6 Sol 在编码、知识工作、网络安全和科学等领域实现了业界领先的成果,同时使用的标记更少,估计成本也低于之前和竞争的前沿模型。在 Agents’ Last Exam 中,Sol 得分 53.6,超出 Claude Fable 5 13.1 分;在中等推理水平下,以约四分之一的估计成本领先 Fable 5 11.4 分。Terra 和 Luna 也分别以约六分之一的成本超越 Fable 5。在 Artificial Analysis Intelligence Index 上,使用 max 推理的 Sol 与 Fable 5 的差距仅为 1 分,同时以约一半的估计成本完成任务,耗时减少 61%。
编码卓越
GPT‑5.6 Sol 在 Artificial Analysis Coding Agent Index 上创下 80 的全新业界最高分,较 Claude Fable 5 高出 2.8 分,同时使用的输出标记不足一半,耗时不足一半,成本约降低三分之一。Terra 的表现略高于 Fable 5,Luna 超越 Claude Opus 4.8;它们均在约三分之一的时间内完成,输出标记约为一半,估计成本约为四分之一。Sol 还在 Terminal‑Bench 2.1 和 DeepSWE 上创下全新业界领先成绩,这两项评估真实代码库中的复杂命令行工作流和长期工程任务。
知识工作与设计判断
GPT‑5.6 Sol 在 BrowseComp 上达到 92.2%,在 OSWorld 2.0 上达到 62.6%,超越 Claude Opus 4.8,同时使用的输出标记减少 85%。该模型能够在 ChatGPT Work 中将自然语言请求转化为精致的交互式解释和可视化。它可从 Slack、Notion、Microsoft 365 和 Google Drive 中提取凌乱的上下文,并转换为专家级、可共享的成果。在演示文稿、文档和电子表格中,Sol 能生成更精致、准确的输出,能够从零创建完全可编辑的演示文稿,并推断幻灯片的设计系统——布局、排版、间距、颜色、重复内容模式——并忠实地将这些规范应用到新材料上。
网络安全能力与安全性
在 ExploitBench 上,GPT‑5.6 Sol 获得 73.5% 的得分,而 GPT‑5.5 在相似的输出标记预算下仅为 47.9%。在 ExploitGym 上,它的最高通过率几乎翻倍,从两小时上限下的 15.1% 上升至 24.9%,在六小时后达到 33.7%。在 SEC‑Bench Pro 上,得分为 71.2%,相较于 GPT‑5.5 的 45.8% 具有更好的延迟表现。该模型支持安全代码审查、补丁、威胁建模和蓝队等防御任务,可通过 OpenAI Daybreak 的 Trusted Access 项目获得验证访问。GPT‑5.6 的安全防护是迄今最强大的,结合了模型内部训练的保护、实时检查、持续监控以及账户级别的强制执行,并辅以推理监视器,对对话进行潜在危害审查。与之前的模型相比,Sol 的网络安全防护大约阻止了十倍的潜在有害活动,同时在低能力模型上重试提示的选项可降低良性使用的摩擦。
Ultra 与多代理工作流
ultra 设置默认并行协调四个代理,以更高的标记使用换取更强的结果和在高需求任务上的更快完成时间。图表显示,添加并行代理会使 BrowseComp、SEC‑Bench Pro 和 Terminal‑Bench 2.1 的分数‑延迟前沿向上并向左移动,并展示了 16‑代理配置。开发者可以使用 Responses API 中的多代理 beta 构建类似 ultra 的体验。max 设置比 xhigh 提供更长的推理时间,使模型能够探索备选方案、运行检查并修正其方法。
可用性、访问方式与定价
GPT‑5.6 Sol、Terra 和 Luna 今日起在 ChatGPT、Codex 和 OpenAI API 上均可使用,全球 rollout 正在进行,预计在接下来的 24 小时内实现全面可用。在 ChatGPT 中,Plus、Pro、Business 和 Enterprise 用户可通过中等及更高的努力设置访问 Sol;Pro 和 Enterprise 用户还可选择 Sol Pro 以获得最高质量的结果。Free 和 Go 用户在 ChatGPT Work 和 Codex 中使用 Terra;Plus、Pro、Business 和 Enterprise 用户可以在 Sol、Terra、Luna 之间进行选择并为每个模型设置努力等级。max 开关对所有在 ChatGPT Work 和 Codex 中有访问权限的用户均可用;ultra 对 ChatGPT Work 中的 Pro 和 Enterprise 用户以及 Codex 中的 Plus 及更高级别计划用户开放。API 开发者可通过 OpenAI API 访问所有三个层级;Responses API 中的编程工具调用让模型编写并运行内存中协调工具的程序,多代理 beta 则实现并发子代理。每 1M 标记的定价为:Sol 输入 $5 / 输出 $30;Terra 输入 $2.50 / 输出 $15;Luna 输入 $1 / 输出 $6。提示缓存更具可预测性,提供明确的缓存断点和 30 分钟的最短缓存寿命;缓存写入按未缓存输入费率的 1.25 倍计费,而缓存读取享受 90% 的缓存输入折扣。
结论
GPT‑5.6 提供了一系列模型,提升了每美元的性能边界,引入了超大规模多代理推理,改进了编码、知识工作、设计判断和网络安全防御,并将这些进步与 OpenAI 迄今为止部署的最全面安全系统相结合。