Gemini 3 リリースノート
Google DeepMindは、ユーザーの学習、構築、計画を支援するために、マルチモーダル理解、高度な推論、およびエージェント機能を統合するように設計された、これまでで最もインテリジェントなモデルであるGemini 3を発表しました。このリリースには、Google製品全体で利用可能な高性能モデルであるGemini 3 Proと、非常に複雑なタスク向けの強化された推論モードであるGemini 3 Deep Thinkが含まれています。
最先端の推論とベンチマーク
Gemini 3 Proは、すべての主要なAIベンチマークにおいてGemini 2.5 Proを大幅に上回り、推論、数学、および事実の正確性における新しい基準を確立しています。
パフォーマンス指標
- 総合知能: Gemini 3 Proは、Eloスコア1501でLMArena Leaderboardのトップに立ちます。
- 博士レベルの推論: このモデルは、Humanity’s Last Exam(ツールなし)で37.5%、GPQA Diamondで91.9%を達成しています。
- 数学: MathArena Apexで23.4%を記録し、フロンティアモデルの新たな最先端を打ち立てました。
- マルチモーダル推論: Gemini 3 Proは、MMMU-Proで81%、Video-MMMUで87.6%を記録しています。
- 事実の正確性: SimpleQA Verifiedで72.1%を達成しています。
Gemini 3 Deep Think
Gemini 3 Deep Thinkは、推論の境界をさらに押し広げる特化モードです。テストでは以下の結果を達成しています:
- Humanity’s Last Exam: 41.0%(ツールなし)。
- GPQA Diamond: 93.8%。
- ARC-AGI-2: 45.1%(コード実行あり、ARC Prize Verified)。これは、新しい課題を解決する能力を示しています。
マルチモーダル学習と検索の統合
Gemini 3は、100万トークンのコンテキストウィンドウと高度な視覚・空間理解を組み合わせ、テキスト、画像、ビデオ、オーディオ、コードにわたる情報を統合します。
教育への応用
Gemini 3は、多言語の手書きレシピを料理本に翻訳したり、学術論文や長いビデオ講義を分析して、インタラクティブなフラッシュカードや視覚化を生成したりすることができます。また、スポーツビデオ(例:ピックルボール)を分析して、フォームの改善やトレーニングプランを提供することも可能です。
検索におけるAIモード
Geminiは、初日からGoogle検索に搭載されます。検索におけるAIモードは、Gemini 3を活用して、ユーザーのクエリに基づいてその場で生成される没入型のビジュアルレイアウトやインタラクティブなシミュレーションを含む、生成的なUI体験を実現します。
エージェントによるコーディングとGoogle Antigravity
Gemini 3は、強力な「vibe coding」およびエージェントモデルとして位置付けられており、複雑なソフトウェアタスクを自動化し、開発者の生産性を向上させるように設計されています。
コーディング・ベンチマーク
- Web開発: Gemini 3は、Elo 1487でWebDev Arenaリーダーボードのトップに立ちます。
- ツール使用: ターミナル経由でコンピュータを操作する能力をテストするTerminal-Bench 2.0で54.2%を記録しました。
- コーディング・エージェント: SWE-bench Verifiedにおいて、Gemini 2.5 Proを大幅に上回る76.2%を記録しました。
Google Antigravity
Googleは、エージェント第一主義の開発プラットフォームであるGoogle Antigravityを立ち上げました。従来のAI IDEとは異なり、Antigravityのエージェントはエディタ、ターミナル、ブラウザに直接アクセスできるため、エンドツーエンドのソフトウェアタスクを自律的に計画、実行、検証することができます。このプラットフォームは、Gemini 3 Pro、ブラウザ制御用のGemini 2.5 Computer Useモデル、および画像編集モデルのNano Banana (Gemini 2.5 Image) を統合しています。
長期的な計画とパーソナル・エージェンシー
Gemini 3 Proは、より長期的なスパンで確実に計画を立て、一貫した意思決定を維持する能力を向上させています。
- Vending-Bench 2: Gemini 3 Proはこのリーダーボードのトップであり、タスクから逸脱することなく、シミュレーション上の1年間の事業運営において一貫したツール使用と意思決定を維持します。
- 日常的なユーティリティ: これらの改善により、Google AI Ultraのサブスクライバーが利用できるGemini Agentを介して、受信トレイの整理やローカルサービスの予約などのマルチステップのワークフローを処理できるようになります。
安全性と責任
Gemini 3は、これまでのGoogleのAIモデルの中で最も包括的な安全性評価を受けています。主な改善点は以下の通りです:
- 迎合性の低減: ユーザーに単に同意する可能性が低くなりました。
- セキュリティ: プロンプトインジェクションに対する耐性の向上と、サイバー攻撃に対する保護の強化。
- 外部検証: 専門家、UK AISI、およびApollo、Vaultis、Dreadnodeを含む独立した企業との提携により評価が実施されました。