OpenAI GPT-5.2 リリースノート
OpenAIは、プロフェッショナルな知識作業向けに設計されたモデルシリーズであるGPT-5.2を発表しました。このリリースには、3つのバリアント—GPT-5.2 Instant、 GPT-5.2 Thinking、および GPT-5.2 Pro—が含まれており、これらは総合的な知能、長文脈理解、エージェンティックツール呼び出し、および視覚能力を総合的に改善します。
プロフェッショナルな知識作業とGDPval
GPT-5.2 Thinkingは、44の職業にわたるよく指定された知識作業タスクを測定するベンチマークであるGDPvalにおいて、人間の専門家レベル以上のパフォーマンスを示す最初のOpenAIモデルです。これは、比較の70.9%でトップの業界プロフェッショナルを上回るか同等です。
Key performance metrics for professional tasks include:
- 効率: GPT-5.2 Thinkingは、専門家のプロフェッショナルのコストの1%未満で、11倍以上の速度で出力を生成します。
- 財務モデリング: 内部のジュニア投資銀行アナリストのスプレッドシートタスクにおいて、GPT-5.2 Thinkingは68.4%を獲得し、GPT-5.1の59.1%から9.3%向上しました。
- 成果物: このモデルは、労働力計画モデル、スプレッドシート、プレゼンテーションの生成において、洗練度が向上しています。
ソフトウェアエンジニアリングとコーディング
GPT-5.2 Thinkingは、ソフトウェアエンジニアリングにおいて新たな最先端を確立し、SWE-Bench Pro(4つの言語をテスト)で55.6%、SWE-bench Verifiedで80%を獲得しました。
Technical improvements in coding include:
- エンドツーエンド実行: 本番コードのデバッグ、機能リクエストの実装、大規模コードベースのリファクタリングにおける信頼性が向上しました。
- フロントエンド開発: 非定型UI作業と3D要素における能力が強化されました。
- エージェンティック統合: Windsurf CEOのJeff Wangを含む早期テスターは、GPT-5.2がエージェンティックコーディングにおいて大きな飛躍を示し、脆弱なマルチエージェントシステムを単一の「メガエージェント」に集約できることを指摘しました。
長文脈推論と視覚
GPT-5.2 Thinkingは、256kトークンまでのコンテキストにおいて、4-needle MRCRバリアントでほぼ100%の精度を達成し、これによりGPT-5.1よりも大幅に正確になります。
Vision capabilities have also been upgraded:
- エラー削減: チャート推論とソフトウェアインターフェース理解のエラー率が約半分に削減されました。
- 空間認識: モデルは、画像内の相対レイアウトと要素の位置づけについてより強い理解を示し、たとえばマザーボード上のコンポーネントの識別が可能になります。
- インターフェース理解: ScreenSpot-Proにおいて、GPT-5.2 Thinkingは(Python有効時)86.3%を獲得し、GPT-5.1 Thinkingの64.2%と比較しています。
数学、科学、および抽象的推論
GPT-5.2 ProとThinkingは、科学の加速におけるリーディングモデルとして位置づけられています:
- GPQA Diamond: GPT-5.2 Proはこの大学院レベルの科学ベンチマークで93.2%、GPT-5.2 Thinkingは92.4%を達成しました。
- FrontierMath: GPT-5.2 ThinkingはTier 1–3タスクにおいて新たな最先端を達成し、問題の40.3%を解決しました。
- 競争数学: ProおよびThinkingの両バージョンはAIME 2025で100%を達成しました。
- ARC-AGI: GPT-5.2 ProはARC-AGI-1(Verified)で90.5%を記録し、90%の閾値を初めて超えるモデルとなりました。より難しいARC-AGI-2(Verified)では、GPT-5.2 Proは54.2%に到達しました。
ツール呼び出しと事実性
GPT-5.2 ThinkingはTau2-bench Telecomで98.7%を達成し、マルチターンツール使用における高い信頼性を示しています。また、遅延に敏感なケースでreasoning.effort='none'が設定されている場合、GPT-5.1およびGPT-4.1よりも推論において優れた性能を発揮します。
事実性については、最大の推論努力と検索ツールを使用した場合、GPT-5.2 Thinkingではエラーを含む応答がGPT-5.1 Thinkingに比べて相対的に30%少なくなりました。
モデルバリアントと利用可能性
OpenAIは、異なるユーザーのニーズに合わせて、モデルの3つの異なるバージョンを展開しています:
| Model | Primary Use Case | Key Characteristic |
|---|---|---|
| GPT-5.2 Instant | 日常の作業、学習、および翻訳 | 高速、会話的、かつ明確な説明 |
| GPT-5.2 Thinking | 複雑なコーディング、長文書の合成、および数学 | 深い推論と洗練された出力 |
| GPT-5.2 Pro | 高難易度の質問とプログラミング | 最も賢明で、最も信頼でき、遅延が高い |
APIの価格とアクセス
GPT-5.2は、Responses APIおよびChat Completions APIを通じて利用可能です。
- 命名:
gpt-5.2(Thinking)、gpt-5.2-chat-latest(Instant)、およびgpt-5.2-pro(Pro)。 - 価格: 100万入力トークンあたり1.75ドル、100万出力トークンあたり14ドル(キャッシュされた入力に対して90%の割引あり)。
- 推論努力: ProおよびThinkingモデルは現在、第5の推論努力レベル
xhighをサポートします。
セーフティとコンテンツ保護
GPT-5.2は、役立ちさと安全境界のバランスを取るために『safe completion』研究を実装しています。メンタルヘルスの苦痛、自害、および感情的依存を含む応答に対して改善が行われました。
さらに、OpenAIは18歳未満のユーザーに対してコンテンツ保護を自動的に適用するための年齢予測モデルを展開しています。メンタルヘルスの評価において、GPT-5.2 Thinkingは自害に対して0.963、メンタルヘルスベンチマークに対して0.915を獲得し、これに対しGPT-5.1 Thinkingは0.684でした。
Sources
- OriginalIntroducing GPT-5.2