OpenAI ディープリサーチ

Overview

OpenAIは、ディープリサーチと呼ばれる新しいエージェント型機能をChatGPT内に導入しました。これは複雑でマルチステップのインターネットリサーチを自動化するように設計されています。数百のオンライン情報源を統合することで、このツールは通常人間が数時間かかるリサーチタスクを数十分で完了させ、完全なドキュメントと引用を含む包括的なレポートを生成します。

Technical Foundation and Methodology

ディープリサーチは、ウェブブラウジングとデータ分析に特化して最適化されたOpenAI o3モデルのバージョンによって駆動されます。

Training and Reasoning

ディープリサーチは、困難なブラウジングと推論タスクに対してエンドツーエンドの強化学習を使用して開発されました。OpenAI o1で使用されている同じ強化学習手法を利用し、モデルに以下のことを可能にします:

  • データを特定するためのマルチステップの軌道を計画・実行する。
  • 遭遇した情報に基づいてリアルタイムで検索戦略をバックトラックおよびピボットする。
  • ユーザーがアップロードしたファイルを閲覧し、Pythonツールを使ってグラフをプロットおよび反復する。
  • 出典から特定の文や段落を引用し、検証可能性を確保する。

Performance Benchmarks

ディープリサーチを駆動するモデルは、いくつかの公開評価で新たな最先端(SOTA)の結果を達成しました:

  • Humanity’s Last Exam: このエキスパートレベルのテスト(100以上の科目)で、モデルは26.6%の精度を達成し、GPT-4o(3.3%)およびOpenAI o1(9.1%)を大幅に上回りました。
  • GAIA: ディープリサーチは、推論、マルチモーダル流暢性、ツール使用をテストするGAIAベンチマークで新たなSOTAを達成し、平均スコア(pass@1)67.36%、および(cons@64)72.57%を記録しました。

Key Capabilities and Use Cases

ディープリサーチは、金融、科学、政策、エンジニアリングなどの分野における集中的なナレッジワーク、および高リスクの消費者リサーチ(例えば、自動車や家電製品の購入など)のために設計されています。

Functional Differences from GPT-4o

GPT-4oはリアルタイムのマルチモーダル会話に最適化されていますが、ディープリサーチは深さ、詳細、検証が重要なマルチファセットでドメイン固有の問い合わせに構築されています。これにより、簡単なサマリーが文書化された成果物に変換されます。

Workflow and User Experience

ユーザーはChatGPTのメッセージコンポーザーで「ディープリサーチ」を選択し、クエリを入力します。このプロセスは通常5〜30分かかります。この間、サイドバーでは実行された手順と使用された情報源のリアルタイムサマリーが提供されます。最終的な出力はチャット内の詳細なレポートです。

Access and Iterative Updates

OpenAIは、高い計算負荷を管理するためにディープリサーチを反復的に展開しています。

Availability and Limits

2025年4月24日現在、使用制限は効率を向上させるためにo4-miniで駆動される軽量版を含むように更新されました:

  • Proユーザー: 月250クエリ。
  • Plus、Team、Enterprise、およびEduユーザー: 月25クエリ。
  • Freeユーザー: 月5クエリ。

Feature Evolution

  • 2026年2月10日: MCPまたはアプリへの接続性を追加し、信頼できるサイトに検索を制限する機能、リアルタイムの進捗追跡、フォローアッププロンプトによる研究の中断と改良を追加しました。
  • 2025年7月17日: ChatGPTエージェントを介して「エージェントモード」を導入し、より広範かつ深いリサーチのためのビジュアルブラウザへのアクセスを提供しました。

Limitations and Safety

その機能にもかかわらず、ディープリサーチには既知の制限があります:

  • 精度: 以前のChatGPTモデルよりも低い率ではありますが、事実を幻視したり誤った推論をすることがあります。
  • キャリブレーション: モデルは時に噂と権威ある情報を区別することに苦労し、不確実性を正確に伝えることができない場合があります。
  • フォーマット: レポートや引用に軽微なフォーマットエラーが生じることがあります。

安全性については、OpenAIの準備フレームワークにより、ディープリサーチを駆動するo3の初期バージョンはMediumリスクと特定されました。ラボはウェブブラウジングリスクに特化した緩和策を実装し、限定リリースの監視を続けています。

Future Roadmap

OpenAIは、サブスクリプションベースまたは社内リソースなどの専門的なデータソースへのディープリサーチのアクセスを拡大する計画です。長期的なビジョンは、ディープリサーチ(非同期調査)とOperator(実際の世界でのアクション)を統合し、ChatGPTがますます高度なエンドツーエンドタスクを実行できるようにすることです。

Sources