OpenAI GPT-6 提示快取更新
OpenAI 已為 GPT-6 系列模型推出改進的提示快取系統,以支援執行複雜、多回合任務的持久化代理。此系統可降低回應時間,並透過在 API 請求之間重用共享內容,為開發者提供最高達 90% 的快取輸入權杖折扣。
提升的快取命中率與定價
GPT-6 內建的快取系統預設提供更高的快取命中率。該系統針對在 30 分鐘內重複使用的合資格共享前置詞提供快取折扣。
監控與診斷工具
OpenAI 引入了兩個新工具,協助開發者管理與優化其快取效能:
- 提示快取儀表板:一個可讓開發者追蹤命中率隨時間變化的工具,並使用輸入組成圖表比較快取與未快取的權杖數量。
- 提示快取診斷工具:一個用於調查意外快取未命中情況的實用工具。它允許開發者將請求與近期回應進行比較,以識別導致無法重用的模型、工具、設定或輸入變更。該工具會提供受影響權杖的估計數量,協助評估快取未命中的影響。
GPT-6 快取的最佳化策略
開發者可使用多項新控制功能,以最大化快取命中率並降低延遲:
明確的快取斷點
開發者現在可選擇要重用的提示前置詞,透過明確的快取斷點,實現對快取內容更細緻的控制。
動態推理努力
在 GPT-6 模型上,開發者可在不破壞快取的情況下調整回應之間的推理努力。這透過附加 configuration_update 實現,同時保持請求層級的推理努力不變,讓開發者能根據任務難度調整推理強度,而不會失去可重用的上下文。
穩定的工具與指令管理
為在工具與指令演進時保持快取穩定,OpenAI 建議保持工具定義、結構與順序的穩定。開發者應遵循以下建議:
- 使用
allowed_tools來限制可呼叫的工具,而非移除定義。 - 當不需要工具時,將
tool_choice設為none。 - 使用開發者訊息將新指令附加至上下文結尾,以覆蓋舊的指令。
快取預熱
快取預熱允許應用程式提前準備已知的上下文(例如共享指令、工具定義或參考資料)。這可將處理這些上下文的時間移出使用者等待時間,從而降低初始回應延遲。
Sources
- OriginalBetter prompt caching for GPT-6