OpenAI 提示快取 API 發佈
OpenAI 推出了提示快取(Prompt Caching),這項功能讓開發者透過重複使用最近見過的輸入代幣來降低成本與延遲。對於涉及長篇多輪對話或對大型程式碼庫進行重複編輯的應用特別有益。
提示快取定價與模型可用性
提示快取會自動套用於最新版本的 GPT-4o、GPT-4o mini、o1-preview 與 o1-mini,包括它們的微調版本。相較於未快取的輸入代幣,快取的輸入代幣價格享有 50% 的折扣。
| 模型 | 未快取輸入代幣 | 快取輸入代幣 | 輸出代幣 |
|---|---|---|---|
| gpt-4o-2024-08-06 | $2.50 | $1.25 | $10.00 |
| GPT-4o fine-tuning | $3.75 | $1.875 | $15.00 |
| gpt-4o-mini-2024-07-18 | $0.15 | $0.075 | $0.60 |
| GPT-4o mini fine-tuning | $0.30 | $0.15 | $1.20 |
| o1-preview | $15.00 | $7.50 | $60.00 |
| o1-mini | $3.00 | $1.50 | $12.00 |
技術實作與快取邏輯
提示快取會自動套用於長度超過 1,024 代幣的提示。系統會快取先前已計算過的提示中最長的前綴,起始最少 1,024 代幣,並以 128 代幣為增量遞增。
開發者無需對 API 整合做任何修改即可享受折扣,因為系統會自動辨識並套用常見前綴的快取。
快取監控與生命週期
API 回應現在在 usage 欄位中加入 cached_tokens 值,讓開發者能監控快取使用情況。
快取會根據不活躍期間進行管理:
- 快取通常在 5 至 10 分鐘不活躍後被清除。
- 快取一定會在最後一次使用後的一小時內被移除。
隱私與安全
提示快取不會在組織之間共享,確保快取資料保持隔離。此功能遵循 OpenAI 企業版的隱私承諾。
Sources
- OriginalPrompt Caching in the API