Gemini 2.5 Deep Think リリース

Google DeepMindは、Google AI Ultra加入者向けのGeminiアプリにDeep Thinkを統合し、複雑な問題解決のための高度な推論を可能にしました。このリリースでは、並列思考と拡張推論時間を活用するモデルのバージョンを導入し、数学、コーディング、科学研究などの高度な技術領域でのパフォーマンスを向上させます。

並列思考と拡張推論

Deep Thinkは、並列思考技術を用いてGeminiの推論能力を強化し、モデルが答えを最終決定する前に複数のアイデアを同時に生成、評価、組み合わせることを可能にします。このプロセスは、主に2つの技術的要因によって支えられています:

  • Extended "Thinking Time": 推論時間を延長することで、モデルはより多くの仮説を探索し、複雑な問題に対する解決策を洗練させることができます。
  • Reinforcement Learning: Google DeepMindは、モデルがこれらの拡張された推論パスを活用するよう促す新しい強化学習技術を開発し、時間とともに直感的な問題解決能力を向上させました。

パフォーマンスとユースケース

Deep Thinkは、反復的な開発、戦略的計画、段階的な洗練が必要なタスク向けに設計されています。主な強みの領域は以下の通りです:

コーディングとアルゴリズム開発

Deep Thinkは、問題の定式化、時間計算量、トレードオフの考慮が重要となる難しいコーディング課題で卓越した性能を発揮します。競技プログラミングのパフォーマンスを測定するLiveCodeBench V6で最先端の成果を達成しています。

科学的・数学的発見

このモデルは、複雑な科学文献を推論し、数学的予想を構築することが可能です。Gemini 2.5 Deep Thinkのフルバージョンは国際数学オリンピック(IMO)で金メダル基準を達成しましたが、Geminiアプリで利用可能なバージョンは日常使用向けに最適化され、内部評価に基づく2025年IMOベンチマークで銅メダルレベルのパフォーマンスに到達しています。

反復的デザイン

Deep Thinkは、複雑なコンポーネントを一つずつ構築することで、ウェブ開発タスクの美観と機能性の両方を向上させます。

これらの領域を超えて、モデルは科学と数学にわたる専門知識を測定するベンチマーク「Humanity’s Last Exam」でも最先端のパフォーマンスを達成しています。

安全性と責任

Gemini 2.5 Deep Thinkは、Gemini 2.5 Proと比較してコンテンツの安全性とトーンの客観性が向上しています。しかし、内部テストでは善意のリクエストを拒否する傾向が高まっていることが示されました。Google DeepMindは、モデルの複雑性増大に伴うリスクに対処するため、最先端の安全性評価を実施し、重要な能力レベルに対する緩和策を導入しています。

利用可能性と実装

Deep Thinkは、Geminiアプリ内でGoogle AI Ultra加入者向けに利用可能です。ユーザーは、モデルのドロップダウンで「2.5 Pro」を選択し、プロンプトバーで「Deep Think」オプションを切り替えることで有効化できます。

主な運用詳細は以下です:

  • Tool Integration: Deep ThinkはGoogle Searchおよびコード実行と自動的に連携します。
  • Response Length: このモデルは標準バージョンよりもはるかに長い応答を生成できます。
  • API Access: Deep Thinkのツール有無のバージョンが、今後数週間でGemini APIを通じて信頼できるテスターに提供され、開発者とエンタープライズの評価に利用されます。

Sources