OpenAI GPT-6 提示缓存更新
OpenAI 已为 GPT-6 系列模型推出改进的提示缓存系统,以支持执行复杂多轮任务的持久化代理。该系统可降低响应时间,并通过在 API 请求间复用共享上下文,为开发者提供高达 90% 的缓存输入令牌折扣。
更高的缓存命中率与定价
GPT-6 实现了一个默认提供更高缓存命中率的缓存系统。该系统对在 30 分钟窗口内重复使用的符合条件的共享前缀提供缓存折扣。
监控与诊断工具
OpenAI 引入了两款新工具,帮助开发者管理和优化缓存性能:
- 提示缓存仪表板:一个工具,允许开发者跟踪命中率随时间的变化,并使用输入组成图表比较缓存与未缓存的令牌数量。
- 提示缓存诊断工具:一个用于调查意外缓存未命中的实用工具。它允许开发者将请求与最近的响应进行比较,以识别导致无法复用的模型、工具、设置或输入变化。该工具提供受影响令牌的估算数量,帮助评估缓存未命中的影响。
GPT-6 缓存的优化策略
开发者可以使用几种新控制手段来最大化缓存命中率并降低延迟:
显式缓存断点
开发者现在可以选择哪些提示前缀进行复用,通过显式缓存断点实现对缓存内容的更细粒度控制。
动态推理努力
在 GPT-6 模型上,开发者可以在不破坏缓存的情况下更改响应间的推理努力。通过附加 configuration_update,同时保持请求级别的推理努力不变,可以在不丢失可复用上下文的前提下,根据任务难度调整推理强度。
稳定的工具与指令管理
为在工具和指令演进过程中保持缓存稳定,OpenAI 建议保持工具定义、模式和顺序的稳定。开发者应:
- 使用
allowed_tools限制可调用工具,而不是删除定义。 - 在不需要工具时将
tool_choice设置为none。 - 使用开发者消息将新指令附加到上下文末尾,以覆盖旧指令。
缓存预热
预热允许应用程序提前准备已知上下文(如共享指令、工具定义或参考材料)。这将该上下文的处理移出用户等待时间,从而降低初始响应延迟。
Sources
- OriginalBetter prompt caching for GPT-6