OpenAI GPT-5.6 リリース: フロンティアインテリジェンスと効率の融合

OpenAIは、幅広いタスクにおいて高レベルの能力とコスト効率のバランスを取るように設計されたGPT-5.6モデルファミリーを導入しました。フラッグシップモデルであるGPT-5.6 Solは、Artificial Analysis Coding Agent IndexにおいてClaude Fable 5を上回りながら、コストは半分以下です。また、このファミリーには、半分の価格でGPT-5.5のインテリジェンスベンチマークに匹敵するTerra、そして最も高速かつ手頃な価格のオプションであるLuna(Solの価格の80%少ない価格)が含まれます。

トークンあたりのインテリジェンス効率

GPT-5.6は、トレーニング中にタスクの成功と効率の両方を最適化することにより、これまでで最高のトークンあたりのインテリジェンス効率を達成します。このアプローチにより、モデルはタスク完了へのより直接的なパスを取るように形成され、トークンあたりの作業量を実際に増加させます。

推論スタックの最適化

OpenAIは、レイテンシ、信頼性、インテリジェンスを損なうことなく同じハードウェアでより多くのトークンを提供できるように推論スタックを最適化しました。これらの改善は、Codex内でのGPT-5.6 Solの使用によってシステムを自律的に最適化することが主な要因です。

ロードバランシングとルーティング

Codex内のGPT-5.6 Solは、本番トラフィックを分析し、リクエストのルーティングのためのヒューリスティックを調整するために使用されました。これには、地理と容量に基づいてリクエストをグローバルに分散させる方法の最適化、およびアクセラレータとコンピューティングコア全体のクラスターとインスタンス内でリクエストをパーティション分割する方法の最適化が含まれます。

カーネル最適化とGPUパフォーマンス

メモリの移動と非効率的なデータレイアウトによるGPUのアイドル時間を削減するため、GPT-5.6 Solは自律的に本番カーネルを書き換え、最適化しました。オープンソースのGPUプログラミング言語TritonとGluonを使用し、これらのカーネルの進歩によりエンドツーエンドのサービスコストが20%削減されました。OpenAIは、オープンソースのFloating-Point Sanitizer (FpSan)を使用して、これらのAI生成カーネルの正確性を検証しました。

スペキュラティブデコード

スペキュラティブデコードの改善により、トークン生成効率が15%以上向上しました。GPT-5.6 Solは、自身のドラフト(スペキュレータ)モデルのために何百ものアーキテクチャ実験を設計・テストし、トレーニングプロセスを自律的に管理し、ハードウェアの故障や不安定時に介入しました。

ワークロード固有の構成

Codex内のGPT-5.6 Solを使用して、OpenAIは広範なヒューリスティックから推論エンジンのハイパー最適化された構成へと移行しました。本番ワークロードを分析することにより、システムは特定のプロンプトと出力の長さおよびクエリの特性に基づいて、バッチング、シャーディング、KVキャッシュ管理を最適化します。

エージェンティックハーネスとオーケストレーション

ChatGPT WorkとCodexは、Rustベースのオーケストレーションレイヤーであるエージェンティックハーネスを使用し、複数のモデルリクエストとツール呼び出しを含む複雑なタスクを管理します。このハーネスは、反復作業を削減して全体のパフォーマンスを向上させることに焦点を当てています。

コンテキストの肥大化を削減

ハーネスは、遅延ディスカバリーを採用し、統合、カスタムMCPツール、およびプラグインが必要なときのみ表示されるようにします。予期しないコンテキストウィンドウの消費を防ぐため、ツールの出力はデフォルトで10,000トークンに上限が設定され、モデルが明示的に異なる制限を要求しない限り適用されます。

プロンプトキャッシュとプレフィックスの保存

プロンプトキャッシュのヒット率を最大化するため、ハーネスはモデルが見える履歴を追記専用として扱い、新しいメッセージとツールの結果を挿入する代わりにコンテキストの末尾に追加します。さらに、ツールは決定論的な順序で提示され、ランタイム設定はツール定義に埋め込まれるのではなく実行時に適用され、これによりプロンプトプレフィックスが正確で再利用可能な状態を保ちます。

Sources