OpenAI 提示缓存 API 发布
OpenAI 推出了提示缓存,这一功能允许开发者通过重复使用最近出现的输入令牌来降低成本和延迟。这对于涉及长篇多轮对话或对大型代码库进行重复编辑的应用尤为有益。
提示缓存定价与模型可用性
提示缓存会自动应用于最新版本的 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini,包括它们的微调版本。相较于未缓存的输入令牌,缓存的输入令牌价格享受 50% 的折扣。
| 模型 | 未缓存输入令牌 | 缓存输入令牌 | 输出令牌 |
|---|---|---|---|
| gpt-4o-2024-08-06 | $2.50 | $1.25 | $10.00 |
| GPT-4o fine-tuning | $3.75 | $1.875 | $15.00 |
| gpt-4o-mini-2024-07-18 | $0.15 | $0.075 | $0.60 |
| GPT-4o mini fine-tuning | $0.30 | $0.15 | $1.20 |
| o1-preview | $15.00 | $7.50 | $60.00 |
| o1-mini | $3.00 | $1.50 | $12.00 |
技术实现与缓存逻辑
提示缓存会自动应用于长度超过 1,024 令牌的提示。系统会缓存先前已计算的提示的最长前缀,起始最少为 1,024 令牌,并以 128 令牌的增量递增。
开发者无需对其 API 集成进行更改即可享受折扣,因为系统会自动识别并对常见前缀应用缓存。
缓存监控与生命周期
API 响应现在在 usage 字段中包含 cached_tokens 值,便于开发者监控缓存使用情况。
- 缓存通常在 5 到 10 分钟不活动后被清除。
- 缓存始终会在上次使用后一小时内被移除。
隐私与安全
提示缓存不会在组织之间共享,确保缓存数据保持隔离。此功能受 OpenAI 企业隐私承诺的约束。
Sources
- OriginalPrompt Caching in the API