OpenAI GPT-5 リリースノート

OpenAIは、以前のモデルよりも知能において大きな飛躍を遂げた統合AIシステムであるGPT-5を発表しました。高速で効率的なモデルとより深い推論モデル(GPT-5 thinking)の間を動的に選択するリアルタイムルーターを統合することにより、コーディング、数学、ライティング、ヘルスの分野で最先端のパフォーマンスを提供します。

Unified System Architecture

GPT-5は、標準クエリ向けのスマートで効率的なモデル、複雑な問題向けの「GPT-5 thinking」と呼ばれる深層推論モデル、およびリアルタイムルーターという3つのコアコンポーネントからなる統合システムとして動作します。ルーターは、会話の複雑さ、ツールの要件、ユーザーの意図(例:「この件についてよく考えてください」などのプロンプト)、および会話の種類に基づいて適切なモデルを決定します。

継続的な可用性を確保するため、プライマリ使用制限に達した後は、各モデルの「mini」バージョンがクエリを処理します。OpenAIは将来、これらの別々の機能を単一のモデルに統合する意向です。

Technical Capabilities and Domain Performance

GPT-5は、いくつかの重要なベンチマークにおいて新たな最先端(SOTA)結果を達成し、専門分野における知能の向上を示しています:

  • Mathematics: AIME 2025でツールを使わずに94.6%。
  • Coding: SWE-bench Verifiedで74.9%、Aider Polyglotで88%。
  • Multimodal Understanding: MMMUで84.2%。
  • Health: HealthBench Hardで46.2%。
  • General Science: GPT-5 proはツールを使わずにGPQAで88.4%を達成。

Coding and Development

GPT-5は、OpenAIがこれまでに提供した中で最も強力なコーディングモデルであり、大規模リポジトリのデバッグや複雑なフロントエンド生成において具体的な進歩があります。このモデルは、タイポグラフィーや間隔などの美的デザインを直感的に理解し、単一のプロンプトから応答性の高いウェブサイトやアプリを生成することができます。

Health and Medical Information

GPT-5は、以前のモデルと比較してHealthBenchでのスコアが大幅に向上しています。懸念を積極的にフラグ付けし、clarifying質問をすることで、アクティブな思考パートナーとして機能します。ユーザーの地理、知識レベル、コンテキストに基づいて応答を調整し、より安全で信頼性の高い情報を提供します。

Creative Writing and Expression

このモデルは、構造の曖昧さや文学的深み(例えば、自由詩や韻を踏まないイアミック・ペンタメーターを維持することなど)を扱う能力が向上しており、プロフェッショナルなレポート、メール、メモの作成においてより効果的です。

Reliability, Factuality, and Honesty

GPT-5は、前世代と比較して幻覚と欺瞞的な動作を大幅に削減しています:

  • Factuality: 応答はGPT-4oと比較して事実誤りを含む可能性が約45%低くなります。「thinking」モードを使用すると、GPT-5はOpenAI o3と比較して事実誤りを含む可能性が約80%低くなります。
  • Open-Ended Factuality: LongFactとFActScoreベンチマークにおいて、「GPT-5 thinking」はo3と比較して幻覚を6倍少なく生成しました。
  • Honesty: マルチモーダルプロンプトから画像が削除されたテスト(CharXiv)では、GPT-5は存在しない画像について確信を持って答える割合がわずか9%であり、o3の86.7%と比較して低いです。本番トラフィックにおける欺瞞率は、o3の4.8%からGPT-5の2.1%に低下しました。

Safety and Behavioral Refinements

Safe Completions Paradigm

OpenAIは、単純な拒否ベースの安全トレーニングから、「safe completions」アプローチに移行しました。この方法は、安全境界内で可能な限り役立つ回答を提供するようにモデルを教えるもので、部分的な回答や高レベルの概観を含むことがあります。拒否が必要な場合は、モデルは理由を説明し、安全な代替案を提供するようにトレーニングされます。

Reduction of Sycophancy

GPT-5は、過度に同意しがちな傾向を減らし、不要な絵文字の使用を抑えるように設計されています。ターゲットを絞った評価では、迎合的な返信が14.5%から6%未満に減少し、「博士レベルの知能を持つ助けになる友人」のようなトーンを目指しています。

Biological Risk Safeguards

「GPT-5 thinking」モデルが生物学および化学分野で「High capability」と分類されているため、OpenAIは多層防御システムを実装しました。これには、CAISIおよびUK AISIなどのパートナーとともに5,000時間のレッドチーム演習、常時稼働の分類器、および推論モニターが含まれ、生物学的リスクを最小限に抑えることを目的としています。

GPT-5 Pro and Access Tiers

GPT-5 proはOpenAI o3-proに代わるものです。スケールされた並列テストタイムコンピューティングを利用し、最も複雑なタスクに対して拡張された推論を提供します。1,000の経済的に価値のある推論プロンプトの評価において、外部の専門家はGPT-5 proを「GPT-5 thinking」よりも67.8%の時間で好み、主要なエラーが22%少ないことを指摘しました。

Availability:

  • Free Users: GPT-5へのアクセス。使用制限に達した後はGPT-5 miniに移行します。
  • Plus, Team, and Pro Users: 使用制限が高くなります。ProサブスクライバーはGPT-5への無制限アクセスと、GPT-5 proへの独占的アクセスを受け取ります。
  • Enterprise and Edu: 来週以降にアクセスが展開されます。
  • Developer Access: Pro、Plus、Teamユーザー向けにCodex CLIを通じて利用可能です。

Sources