GPT-5.6 リリースノート: エージェントの価格性能比の向上

OpenAIは、最先端レベルのエージェント性能をより手頃な価格で提供しつつ、自律型エージェントの能力を拡張するように設計されたGPT-5.6モデルファミリーを導入しました。このリリースは、価格性能比の効率を高めることに焦点を当てており、開発者がトークン消費量と運用コストを削減しながら、高い精度を維持することを可能にします。

強化された価格性能比とモデル選択

GPT-5.6は、前世代と比較して、より少ない推論コストでより高い精度を提供します。Agents’ Last Examベンチマークでのテストにおいて、GPT-5.6 Solの「low」推論設定では、一定のハーネスを使用した場合、GPT-5.5の「high」推論設定を上回る性能を示しました。

開発者は、テスト時計算量(test-time compute)を活用することで、5.6ファミリー内のLunaやTerraといった、よりコスト最適化されたモデルを使用して、フラッグシップレベルの性能を達成できるようになりました。この変化は、BrowseComp検索ベースのベンチマークによって証明されています。

  • GPT-5.5 (Extra High): $33.27のコストで84.36%を記録。
  • GPT-5.6 Luna (Extra High): $1.33のコストで84.04%を記録。

LunaやTerraのような小型モデルは、大量のワークロード、レイテンシに敏感なインタラクション、および手書きメモからのデータ抽出といったエージェント・ワークフローにおける反復的なステップに特に推奨されます。

エージェント・アーキテクチャのための Responses API の更新

OpenAIは、エージェントの効率を向上させるために、3つのアーキテクチャ上の介入をResponses APIに導入しました。

1. 推論の永続化と圧縮

GPT-5.6では、モデルのターンをまたいで推論を永続化させることができ、また、長時間の会話を圧縮するためにネイティブな圧縮機能を利用できます。これらの機能により、モデルが長期的なタスク・ホライゾンにおいて一貫性を失ったり、コンテキストを再構築したりする必要が生じるのを防ぎます。ARC-AGI-3ベンチマークにおいて、保持された推論と圧縮を有効にすることで、GPT-5.6 Solのスコアは、約6— fewer output tokensを使用しながら、13.3%から38.3%に向上しました。

2. ネイティブなマルチエージェント・オーケストレーション

Responses APIは、現在、ネイティブなマルチエージェント・オーケストレーションをサポートしており、プライマリ・エージェントがサブエージェントにタスクを委譲し、並列で作業を行うことが可能になりました。推論を並列ワークストリームに分散させることで、タスク完了速度と全体的な知能が向上します。このオーケストレーションは、ChatGPTの「ultra」機能設定の基盤でもあります。

3. プログラマティックなツール呼び出し

「コンテキストの腐敗(context rot)」を軽減し、コストを削減するために、プログラマティックなツール呼び出しにより、GPT-5.6はJavaScriptを記述して、モデルのコンテキスト・ウィンドウの外側でツールをオーケストレートし、出力を処理(データのフィルタリングや集計など)することが可能になります。これにより、判断を必要とするタスクのためにモデルのトークンを確保できます。

プロンプト・キャッシュの改善

OpenAIは、プロンプト・キャッシュのTime-to-Live (TTL) を最低30分に延長しました。さらに、開発者は、キャッシュ・ヒット率を向上させるために、モデルのコンテキスト・ウィンドウ内で決定論的にキャッシュ・ブレークポイントを設定できるようになりました。リクエストが同じ推論エンジンに到達する可能性を高めるために、prompt_cache_key の使用が推奨されます。これにより、レイテンシが低減されます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch