OpenAI Codex Context Size Reduction and System Prompt Updates
OpenAI Codex Context Size Reduction and System Prompt Updates
OpenAIは、Codexモデルのコンテキストウィンドウを372,000トークンから272,000トークンに削減しました。GitHubのプルリクエストを通じて確認されたこの変更は、アテンションメカニズムの二次関数的なスケーリングコストを管理するための最適化策であるとともに、壊滅的なファイルシステムエラーを防ぐためにシステムプロンプトに追加された新しい安全制約によるものと思われます。
Context Window Reduction from 372k to 272k
Codexモデルの最大コンテキストサイズは272kトークンに引き下げられました。この削減は、長いシーケンスを処理するための計算コストが要因である可能性が高いです。
コミュニティメンバーが指摘しているように、純粋な二次関数的アテンションは、372kにおけるトークンのコストが272kにおけるトークンよりも大幅に高い(約87%増)ことを意味します。これにより、トークン処理のコスト、コンテキストの圧縮(compaction)のコスト、そして結果として生じる品質の低下との間でトレードオフが生じます。
Impact on Developer Workflows
ユーザーの反応は、特定のワークロード要件に基づいて分かれています:
- High-Context Users: 大規模なプロジェクト、複数の研究論文、または広範なコーディング規約(一部のユーザーは60-80kトークンのルールファイルがあると報告しています)を管理する開発者は、272kでは不十分であると主張しています。詳細や解像度の喪失につながる頻繁な「圧縮(compaction)」サイクルを避けるために、300kから1Mトークンが必要であると報告するユーザーもいます。
- Low-to-Mid Context Users: 他のユーザーは、200kトークンが通常ワークフローに十分である、あるいはモデルのパフォーマンスを維持するために200kトークンごとに手動でコンテキストをリセットしているため、今回の削減は問題にならないと報告しています。
Context Compaction and Performance Degradation
ハードリミットを超えるコンテキストを処理するために、Codexは「圧縮(compaction)」戦略を採用しています。しかし、このプロセスはユーザーの間で論争の的となっています。
The "Dumb Zone" and Quality Loss
複数のユーザーが、コンテキストウィンドウが埋まるにつれて、あるいは圧縮が発生した後に、モデルの知能が低下することを観察しています:
"The level of detail you lose across compaction is wildly too much for most things that I do... You have about five minutes of conversation and it compacts and then you have to wait for it to read that again."
一部のユーザーは、総ウィンドウサイズに関わらず、120k-150kトークン付近からモデルの有効性が低下する「dumb zone(低知能ゾーン)」が始まると示唆しています。他のユーザーは、圧縮後、モデル(具体的にはGPT 5.5や5.6とされているもの)が元の速度を取り戻すのに苦労したり、圧縮プロセスを生き延びた古い指示メッセージに過剰に反応したりする場合があることを指摘しています。
New Safety Constraints for Destructive Actions
コンテキストサイズの変更に加えて、Codexのシステムプロンプトには、モデルが誤って重要なシステムファイルを削除してしまうのを防ぐために、大幅な更新が行われました。更新されたプロンプトは、モデルに対して以下を明示的に指示しています:
- 破壊的なアクションがユーザーのリクエスト内に明確に含まれていることを確認すること。
- 必要に応じて、読み取り専用チェックを使用して正確なターゲットを解決すること。
$HOME,~,/, またはワークスペースのルートといった広範なディレクトリを、再帰的または破壊的なコマンドのターゲットとして使用することを避けること。
この更新は、Codexがユーザーのホームディレクトリ全体を時折削除してしまうというバグの報告があったことを受けて行われました。
Comparison with Alternative Models
コミュニティの議論では、OpenAIのコンテキスト提供内容と競合他社のものとの間の格差が広がっていることが強調されています:
- Anthropic: ユーザーは、複雑でマルチファイル構成のプロジェクトにおいて、Claudeのより大きなコンテキストウィンドウがCodex over Claude を好む主な理由として頻繁に挙げられています。
- DeepSeek and Others: DeepSeekのKV cache技術や、他のフロンティアモデルで利用可能な1M+トークンのウィンドウが、272kはプロフェッショナルなプログラミングタスクにおいてますます制限として見なされるようになっていることを示唆しています。