OpenAI GPT-6 プロンプトキャッシュの更新
OpenAI は、複雑なマルチターンタスクを実行する永続的なエージェントをサポートするために、GPT-6 ファミリー向けに改善されたプロンプトキャッシュシステムをリリースしました。このシステムにより応答時間が短縮され、APIリクエスト間で共有コンテキストを再利用することで、キャッシュされた入力トークンに対して最大90%の割引が提供されます。
キャッシュヒット率の向上と価格設定
GPT-6 はデフォルトでより高いキャッシュヒット率を実現するキャッシュシステムを採用しています。このシステムは、30分間のウィンドウ内で再利用される有効な共有プレフィックスに対してキャッシュ割引を提供します。
監視および診断ツール
OpenAI は、開発者がキャッシュパフォーマンスを管理および最適化するのを支援する2つの新しいツールを導入しました。
- プロンプトキャッシュダッシュボード: キャッシュヒット率の時間的推移を追跡でき、入力構成チャートを使ってキャッシュ済みとキャッシュ未対応のトークンを比較できるツールです。
- プロンプトキャッシュ診断ツール: 意図しないキャッシュミスを調査するためのユーティリティです。リクエストと最近の応答を比較することで、モデル、ツール、設定、または入力の変更が再利用を妨げた原因を特定できます。また、影響を受けるトークン数の推定値を提供し、キャッシュミスの影響を評価するのに役立ちます。
GPT-6 キャッシュの最適化戦略
開発者は、いくつかの新しいコントロールを活用してキャッシュヒット率を最大化し、レイテンシを削減できます。
明示的なキャッシュブレークポイント
開発者は、明示的なキャッシュブレークポイントを使用して、どのプロンプトプレフィックスを再利用するかを選択できます。これにより、キャッシュ対象をより細かく制御できるようになります。
ダイナミックな推論努力
GPT-6 モデルでは、キャッシュを破壊せずに、応答間で推論努力を変更できます。configuration_update を付加するだけで、リクエストレベルの推論努力は変更せずに、タスクの難易度に応じて推論の強度を調整でき、再利用可能なコンテキストを失うことがありません。
安定したツールおよび指示の管理
ツールや指示が進化してもキャッシュを維持するために、OpenAI はツール定義、スキーマ、順序を安定させることを推奨しています。開発者には以下の点を推奨しています。
- 定義を削除するのではなく、
allowed_toolsを使って呼び出し可能なツールを制限する。 - ツールが必要ない場合は
tool_choiceをnoneに設定する。 - 開発者メッセージを使って、コンテキストの末尾に新しい指示を追加し、古いものを上書きする。
キャッシュの事前暖機
事前暖機により、アプリケーションは既知のコンテキスト(たとえば、共有指示、ツール定義、参照資料など)を事前に準備できます。これにより、そのコンテキストの処理をユーザーの待機時間から移動させ、初期応答レイテンシを削減できます。
Sources
- OriginalBetter prompt caching for GPT-6