GPT-5.6 发布说明:提升智能体性价比
OpenAI 推出了 GPT-5.6 模型系列,旨在降低前沿级智能体性能的成本,同时扩展自主智能体的能力。此次发布重点在于提高性价比效率,允许开发者在减少 token 消耗和运营成本的同时,保持高准确度。
增强的性价比与模型选择
与前几代相比,GPT-5.6 在较低的推理投入下提供了更高的准确度。在 Agents’ Last Exam 基准测试中,使用恒定 harness 时,GPT-5.6 Sol 在“低”推理投入下的表现优于 GPT-5.5 在“高”推理投入下的表现。
开发者现在可以通过利用增加的测试时计算(test-time compute)来使用 5.6 系列中更具成本效益的模型(如 Luna 和 Terra)来实现旗舰级性能。这种转变可以通过 BrowseComp 基于搜索的基准测试得到证实:
- GPT-5.5 (Extra High): 在成本为 $33.27 的情况下得分 84.36%。
- GPT-5.6 Luna (Extra High): 在成本为 $1.33 的情况下得分 84.04%。
对于高吞吐量工作负载、延迟敏感型交互以及智能体工作流中的重复步骤(例如从手写备忘录中提取数据),特别推荐使用 Luna 和 Terra 等较小模型。
针对智能体架构的 Responses API 更新
OpenAI 更新了 Responses API,通过三种架构干预措施来提高智能体效率:
1. 推理持久化与压缩
GPT-5.6 允许推理过程在模型轮次之间持久化,并利用原生压缩功能来压缩长时间运行的对话。这些功能可以防止模型在长任务周期内失去连贯性或需要重建上下文。在 ARC-AGI-3 基准测试中,启用保留推理和压缩功能使 GPT-5.6 Sol 的得分从 13.3% 提高到 38.3%,同时使用的输出 token 减少了约 6 个。
2. 原生多智能体编排
Responses API 现在支持原生多智能体编排,允许主智能体将任务委派给并行工作的子智能体。这种将推理分布到并行工作流中的方式增加了任务完成速度和整体智能水平。这种编排也是 ChatGPT 中“ultra”能力设置的基础。
3. 程序化工具调用
为了减少“上下文腐烂”(context rot)并降低成本,程序化工具调用允许 GPT-5.6 编写 JavaScript 来编排工具并处理输出(例如过滤或聚合数据),从而在模型上下文窗口之外进行操作。这为需要判断力的任务保留了模型 token,而不是用于确定性的数据处理。
Prompt 缓存改进
OpenAI 已将 prompt 缓存的生存时间 (TTL) 延长至至少 30 分钟。此外,开发者现在可以在模型的上下文窗口内确定性地设置缓存断点,以提高缓存命中率。建议使用 prompt_cache_key 来增加请求落在同一个推理引擎上的可能性,从而降低延迟。
Sources
- OriginalThe builder’s guide to GPT‑5.6
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch