OpenAI GPT-5.6 发布:融合前沿智能与效率

OpenAI 推出了 GPT-5.6 模型系列,旨在在广泛的任务中平衡高级能力与成本效率。旗舰模型 GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上的表现优于 Claude Fable 5,而成本仅为其一半。该系列还包括 Terra,其在半价情况下达到 GPT-5.5 的智能基准;以及 Luna,这是最快且最实惠的选择,价格比 Sol 低 80%。

每 token 智能效率

GPT-5.6 通过在训练过程中同时优化任务成功和效率,实现了迄今为止最高的每 token 智能效率。这种方法使模型能够采取更直接的路径完成任务,从而在每个 token 上有效地完成更多工作。

推理栈优化

OpenAI 已优化其推理栈,在不牺牲延迟、可靠性或智能的前提下,使用相同的硬件提供更多 token。这些改进主要得益于在 Codex 中使用 GPT-5.6 Sol 自主优化系统。

负载均衡与路由

在 Codex 中,GPT-5.6 Sol 被用于分析生产流量并调整路由请求的启发式方法。这包括根据地理位置和容量优化请求的全球分布方式,以及在加速器和计算核心的集群和实例内部对请求进行分区的方式。

内核优化与 GPU 性能

为了减少由内存移动和低效数据布局导致的 GPU 空闲时间,GPT-5.6 Sol 自主重写并优化了生产内核。使用开源 GPU 编程语言 Triton 和 Gluon,这些内核进步使端到端服务成本降低了 20%。OpenAI 使用了开源浮点消毒器(FpSan)来验证这些 AI 生成内核的正确性。

投机解码

通过改进投机解码,令牌生成效率提高了超过 15%。GPT-5.6 Sol 为其自身的草拟(投机者)模型设计并测试了数百种架构实验,并自主管理了训练过程,在硬件故障或不稳定时进行干预。

工作负载特定配置

在 Codex 中使用 GPT-5.6 Sol,OpenAI 从广泛的启发式方法过渡到推理引擎的超优化配置。通过分析生产工作负载,系统现在根据特定的提示和输出长度以及查询特性来优化批处理、分片和 KV 缓存管理。

Agentic Harness 与编排

ChatGPT Work 和 Codex 使用一种称为 agentic harness 的 Rust-based 编排层来管理涉及多个模型请求和工具调用的复杂任务。该 harness 专注于减少重复工作以提升整体性能。

减少上下文膨胀

harness 采用延迟发现机制,以确保集成、自定义 MCP 工具和插件仅在必要时出现。为了防止意外的上下文窗口消耗,工具输出默认限制为 10,000 tokens,除非模型明确请求其他限制。

提示缓存与前缀保留

为了最大化提示缓存命中率,harness 将所有模型可见的历史记录视为仅追加,将新消息和工具结果添加到上下文末尾,而不是插入其中。此外,工具以确定性顺序呈现,运行时设置在执行期间应用,而不是嵌入工具定义中,以确保提示前缀保持精确且可重复使用。

Sources