OpenAI GPT-5.4 リリース:統合された推論、コーディング、コンピュータ使用モデル(1Mトークンコンテキスト)

要点

OpenAI は GPT‑5.4 をリリースしました。これはプロフェッショナルな作業向けの最も高性能かつ効率的なフロンティアモデルで、ChatGPT(Thinking として)、API、Codex で利用可能です。さらに高性能な Pro バリアントも提供されます。このモデルはネイティブなコンピュータ使用、最大 1 M トークンのコンテキスト、改良されたツール検索、そして強化された推論・コーディング・知識作業能力を備えており、幅広いベンチマークで精度向上、トークン使用量削減、速度向上を実現します。


リリースの概要

OpenAI は 2026 年 3 月 5 日に GPT‑5.4 の展開を発表しました。このモデルは 3 つのプロダクトラインで提供されます。

  • ChatGPTGPT‑5.4 Thinking(標準)と GPT‑5.4 Pro(最大性能)として利用可能。
  • APIgpt-5.4gpt-5.4-pro エンドポイントでアクセス可能。
  • Codex – 新しいコーディング特化機能と統合。

GPT‑5.4 は推論、コーディング、エージェントワークフローの最新の進歩を統合し、GPT‑5.3‑Codex のコーディング強みを継承しつつ、スプレッドシート、プレゼンテーション、文書、ツールが豊富な環境でのパフォーマンスを拡張します。


主な技術的改善点

統合された推論と計画

  • 事前計画 – ChatGPT では、モデルが応答を生成する前に考え方をアウトライン化し、ユーザーは応答途中で計画を調整できます。
  • 長いコンテキスト – 最大 1 M トークン をサポートし、エージェントが非常に長いタスクでも一貫性を保てます。
  • トークン消費の削減 – 同等の推論に対して GPT‑5.2 より大幅に少ないトークンを使用し、コストとレイテンシを低減します。

ネイティブなコンピュータ使用

  • 初の汎用モデルとして、Playwright などのライブラリを介してアプリケーションを制御し、スクリーンショットからマウス/キーボード操作を発行できるコンピュータ使用機能を内蔵。
  • ツール検索 – すべてのツール定義を事前にロードする代わりに、必要に応じてツール定義を取得でき、ツールが多数あるワークフローでトークン使用量を ≈47 % 削減。
  • ツール呼び出し精度 – Toolathlon や τ2‑bench といったベンチマークでマルチステップツール使用の精度が向上し、インタラクション回数を減らしながら高精度を実現。

ビジョンと知覚

  • original 画像詳細レベル(最大 10.24 M ピクセル)を導入し、high レベルを 2.56 M ピクセルに拡張。ローカライゼーション、クリック精度、密な画像理解が向上。
  • MMMU‑Pro(ツールなし)で 81.2 %、ツールありで 82.1 % を達成し、GPT‑5.2 を上回ります。

コーディング強化

  • GPT‑5.3‑Codex のコーディング強みと新しい推論・ツール機能を統合。
  • Codex の /fast mode はインテリジェンスを犠牲にせず、トークン速度を最大 1.5× 向上。
  • 実験的な Playwright (Interactive) スキルを導入し、Web/Electron アプリの視覚的デバッグと自動テストが可能に。

ベンチマーク性能

ベンチマーク GPT‑5.4 GPT‑5.3‑Codex GPT‑5.2
GDPval(知識作業) 83.0 % 70.9 %
SWE‑Bench Pro(コーディング) 57.7 % 55.6 %
OSWorld‑Verified(デスクトップコンピュータ使用) 75.0 % 74.0 % 47.3 %
WebArena‑Verified(ブラウザ使用) 67.3 % 65.4 %
BrowseComp(ウェブ検索) 82.7 %(標準) / 89.3 %(Pro) 77.3 % 65.8 %
MMMU‑Pro(ビジョン) 81.2 %(ツールなし) / 82.1 %(ツールあり) 79.5 %
Toolathlon(ツール使用) 54.6 % 45.7 %
投資銀行スプレッドシートタスク(社内) 87.3 % 68.4 %
プレゼンテーション品質(人間評価) 68.0 % が GPT‑5.2 より好評価

すべての評価は、特に記載がない限り xhigh の推論努力で実施されました。


実世界での能力

プロフェッショナルな知識作業

  • 44 の職種にわたる GDPval 比較で 83 % のケースで業界の専門家と同等または上回る性能を示す。
  • 事実誤りが減少:個別の主張は 33 % の確率で偽である可能性が低く、全体の応答は GPT‑5.2 と比べ 18 % 低いエラー率。
  • スプレッドシート、プレゼンテーション、文書の品質が向上し、人間評価者は美観と機能的多様性で GPT‑5.4 の出力を好む。

コンピュータ使用エージェント

  • デスクトップナビゲーションで 75 % の成功率(GPT‑5.2 の 47 % を上回る)や、Web インタラクションベンチマークで最大 92.8 %(Online‑Mind2Web)を達成。
  • ツール検索と並列ツール実行によりレイテンシが削減された協調マルチツールワークフローをサポート。
  • 不動産税ポータルタスクで 95 % の初回成功率を示し、セッションは 約3倍 速く完了、トークン使用は 約70 % 減少。

コーディング&開発

  • SWE‑Bench Pro で GPT‑5.3‑Codex を上回り、レイテンシも低減。
  • Playwright (Interactive) スキルにより、コード生成中に視覚的デバッグと自動テストが可能。単一プロンプトからテーマパークシミュレーション全体を構築した例が示されています。

安全性とガバナンス

  • OpenAI の Preparedness Framework に基づき High cyber capability と分類。監視拡充、信頼アクセス制御、Zero Data Retention(ZDR)領域での高リスクリクエストに対する非同期ブロックを実装。
  • オープンソースの CoT controllability 評価を導入し、GPT‑5.4 のチェーン・オブ・ソート思考隠蔽能力が低いことを示し、CoT 監視の有効性を裏付け。
  • 分類器の改善に伴い、ZDR 顧客向けに稀に誤検知での拒否が発生する可能性があります。

利用可能性と価格設定

  • ChatGPT – GPT‑5.4 Thinking は Plus、Team、Pro ユーザー向けにライブ。GPT‑5.4 Pro は Pro と Enterprise プランで利用可能。レガシー GPT‑5.2 Thinking は 2026 年 6 月 5 日まで提供されます。
  • APIgpt-5.4(標準)と gpt-5.4-pro(最大性能)がライブ。価格(1 M トークンあたり):入力 $2.50、キャッシュ入力 $0.25、出力 $15(標準);入力 $30、出力 $180(Pro バリアント)。
  • コンテキストウィンドウ – デフォルト 272 K トークン。実験的な 1 M トークンウィンドウは model_context_windowmodel_auto_compact_token_limit で有効化でき、272 K 超過分は通常料金の 2 倍で課金されます。

開発者と企業への影響

  • 生産性向上 – 計画機能、長いコンテキスト、効率的なツール使用により、複雑タスクに必要なインタラクション回数が削減されます。
  • コスト効率 – トークン単価は高めでも、全体のトークン消費が減少するため実質的なコストは低減。
  • ツールエコシステムの拡大 – ツール検索により、数千のツールをトークンコストを抑えて利用可能に。
  • 信頼性向上 – 幻覚率低下と強化された安全制御により、法務分析、金融モデリング、医療スケジューリングなどのハイステークス領域での利用が適しています。

結論

OpenAI の GPT‑5.4 は、最先端の推論、コーディング、ビジョン、ネイティブコンピュータ使用を単一モデルに統合した、フロンティア AI の重要な進歩です。プロフェッショナル、コーディング、コンピュータ使用ベンチマーク全体での性能向上、トークン効率と安全機能の改善により、複雑な実世界ワークフローに対して高品質かつコスト効果の高い AI アシスタンスを求める企業や開発者にとって魅力的な選択肢となります。


出典

Sources