OpenAI GPT-5.1 リリースノート

OpenAIは、エージェントおよびコーディングワークフローにおける高レベルの知能と実行速度のバランスを取るように設計されたモデルGPT-5.1をリリースしました。このアップデートは、タスクの複雑さに基づいて思考時間を調整する適応的推論、低レイテンシ応答のための専用モード、およびコードとシステムの直接的なやり取りのための新しい開発者ツールを導入します。

アダプティブ推論と効率性

GPT-5.1は、リクエストの複雑さに応じて「思考」に費やす時間とトークンの量を動的に調整できるように改訂されたトレーニングアプローチを利用します。これにより、複雑な問題での信頼性を損なうことなく、シンプルなタスクに対してより高速な応答と低いトークンコストを実現します。

パフォーマンスの向上

  • レイテンシ削減: npmコマンドの要求などのシンプルなクエリに対して、GPT-5.1は応答時間を10秒から2秒に短縮できます。
  • サードパーティ検証: Balyasny Asset Managementは、GPT-5.1がGPT-5より2〜3倍高速で動作し、ツール集約型推論タスクにおいて主要な競合他社の約半分のトークンしか使用しないと報告しました。Paceは、自社のエージェントが50%高速に動作し、GPT-5の精度を上回っていると報告しました。

"推論なし" モード

開発者は、reasoning_effort パラメータを none に設定することで推論を無効にできます。このモードはレイテンシセンシティブなユースケースに最適化されており、GPT-5の「最小」推論設定と比較していくつかの利点があります:

  • 機能の向上: 並列ツール呼び出し、コーディングタスク、指示の従い方、および検索ツールの使用におけるパフォーマンスが向上します。
  • ウェブ検索: APIプラットフォーム内でのウェブ検索をサポートします。
  • 実際の影響: Sierraは、GPT-5の最小推論と比較して低レイテンシツール呼び出しのパフォーマンスが20%向上したことを観測しました。

拡張プロンプトキャッシング

さらにレイテンシとコストを削減するため、GPT-5.1はprompt_cache_retention='24h'パラメータを介して最大24時間の保持が可能な拡張プロンプトキャッシングをサポートします。これは以前の制限に比べて大幅な増加であり、マルチターンチャットのスムーズさと長時間のコーディングセッションを容易にします。キャッシュされた入力トークンは、キャッシュされていないトークンよりも90%安価のままです。

コーディング機能の強化

GPT-5.1は、操作性、コード品質、およびツール呼び出し中のユーザー向けアップデートメッセージの明瞭さにおいてGPT-5を上回ります。シンプルな編集における「過剰な思考」を減らすように特別に最適化されており、複雑なタスクでの高いパフォーマンスを維持します。

ベンチマークと業界フィードバック

  • SWE-bench Verified: GPT-5.1は76.3%のスコアを達成し、GPT-5の72.8%を上回りました。
  • 開発者ツール: Cursor、Cognition、Augment Code、Factory、Warpなどの企業がモデルのコーディングパーソナリティに協力しました。Augment Codeはマルチファイルプロジェクトにおけるより正確な変更と高速なイテレーションを指摘し、Clineは自社のdiff編集ベンチマークで7%の改善を報告しました。

新しい開発者ツール

Responses APIに、より信頼性の高いエージェント動作を可能にするため、2つの新しいツールが導入されます:

apply_patch Tool

このツールは、構造化されたdiffを使用してファイルの作成、更新、削除をモデルに許可します。編集の提案ではなくパッチ操作を出力することにより、JSONエスケープの必要なく、より信頼性の高い反復的マルチステップ編集ワークフローを可能にします。

Shell Tool

シェルツールは、モデルがローカルマシンで実行するコマンドラインインターフェース(CLI)コマンドを提案できるようにします。これにより、モデルがシステムを検査し、ユーティリティを実行し、データを収集してタスクを完了するプラン-エクスキュートループが作成されます。

モデルの可用性とバリエーション

GPT-5.1およびgpt-5.1-chat-latestは、GPT-5と同じ価格とレートリミットのすべての有料APIティアで開発者に利用可能です。さらに、OpenAIはgpt-5.1-codexおよびgpt-5.1-codex-miniをリリースしました。これらは、Codexライクなハーネス内での長時間実行のエージェント型コーディングタスクに特化して最適化されています。

テクニカル評価サマリー

評価 GPT-5.1 (high) GPT-5 (high)
SWE-bench Verified 76.3% 72.8%
GPQA Diamond (no tools) 88.1% 85.7%
AIME 2025 (no tools) 94.0% 94.6%
FrontierMath (with Python) 26.7% 26.3%
MMMU 85.4% 84.2%
Tau 2-bench Airline 67.0% 62.6%
Tau 2-bench Telecom 95.6% 96.7%
Tau 2-bench Retail 77.9% 81.1%
BrowseComp Long Context 128k 90.0% 90.0%

Sources