OpenAI GPT-5.6 发布:融合前沿智能与效率
OpenAI 推出了 GPT-5.6 模型系列,旨在在广泛的任务中平衡高级能力与成本效率。旗舰模型 GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上的表现优于 Claude Fable 5,而成本仅为其一半。该系列还包括 Terra,其在半价情况下达到 GPT-5.5 的智能基准;以及 Luna,这是最快且最实惠的选择,价格比 Sol 低 80%。
每 token 智能效率
GPT-5.6 通过在训练过程中同时优化任务成功和效率,实现了迄今为止最高的每 token 智能效率。这种方法使模型能够采取更直接的路径完成任务,从而在每个 token 上有效地完成更多工作。
推理栈优化
OpenAI 已优化其推理栈,在不牺牲延迟、可靠性或智能的前提下,使用相同的硬件提供更多 token。这些改进主要得益于在 Codex 中使用 GPT-5.6 Sol 自主优化系统。
负载均衡与路由
在 Codex 中,GPT-5.6 Sol 被用于分析生产流量并调整路由请求的启发式方法。这包括根据地理位置和容量优化请求的全球分布方式,以及在加速器和计算核心的集群和实例内部对请求进行分区的方式。
内核优化与 GPU 性能
为了减少由内存移动和低效数据布局导致的 GPU 空闲时间,GPT-5.6 Sol 自主重写并优化了生产内核。使用开源 GPU 编程语言 Triton 和 Gluon,这些内核进步使端到端服务成本降低了 20%。OpenAI 使用了开源浮点消毒器(FpSan)来验证这些 AI 生成内核的正确性。
投机解码
通过改进投机解码,令牌生成效率提高了超过 15%。GPT-5.6 Sol 为其自身的草拟(投机者)模型设计并测试了数百种架构实验,并自主管理了训练过程,在硬件故障或不稳定时进行干预。
工作负载特定配置
在 Codex 中使用 GPT-5.6 Sol,OpenAI 从广泛的启发式方法过渡到推理引擎的超优化配置。通过分析生产工作负载,系统现在根据特定的提示和输出长度以及查询特性来优化批处理、分片和 KV 缓存管理。
Agentic Harness 与编排
ChatGPT Work 和 Codex 使用一种称为 agentic harness 的 Rust-based 编排层来管理涉及多个模型请求和工具调用的复杂任务。该 harness 专注于减少重复工作以提升整体性能。
减少上下文膨胀
harness 采用延迟发现机制,以确保集成、自定义 MCP 工具和插件仅在必要时出现。为了防止意外的上下文窗口消耗,工具输出默认限制为 10,000 tokens,除非模型明确请求其他限制。
提示缓存与前缀保留
为了最大化提示缓存命中率,harness 将所有模型可见的历史记录视为仅追加,将新消息和工具结果添加到上下文末尾,而不是插入其中。此外,工具以确定性顺序呈现,运行时设置在执行期间应用,而不是嵌入工具定义中,以确保提示前缀保持精确且可重复使用。