Gemini 3 Pro リリースノート

Google DeepMindは、エージェンティックなワークフローと複雑なゼロショットタスクを強化するために設計された高知能モデル、Gemini 3 Proを発表しました。Gemini 3 Proは、すべての主要なAIベンチマークにおいて以前のバージョンを上回っており、特にコーディングおよび推論能力においてGemini 2.5 Proを凌駕しています。

エージェンティックなコーディングと開発ツール

Gemini 3 Proは、エージェンティックなコーディングの基盤として機能し、ターミナルを介してコンピュータを操作する能力を測定するTerminal-Bench 2.0で54.2%のスコアを記録しました。このモデルは、Android Studio、Gemini CLI、Cursor、GitHub、JetBrains、Manus、Clineを含む複数の開発者ツールに統合されています。

Google Antigravity

Google Antigravityは、開発者がワークスペース全体で自律的なエージェントを管理しながら、アーキテクトとして行動することを可能にする新しいエージェンティック開発プラットフォームです。これらのエージェントは、エディタ、ターミナル、ブラウザを横断して操作し、複雑なソフトウェアタスクを計画・実行し、詳細なアーティファクトを介して進捗を伝達できます。このプラットフォームは、MacOS、Windows、Linux向けにパブリックプレビューとして提供されています。

Gemini API の強化

エージェンティックなワークフローをサポートするために、Gemini APIに新しいツールが追加されました:

  • Bash Tools: クライアントサイドのbashツールにより、モデルがローカルファイルシステムのナビゲーションやシステム自動化のためのシェルコマンドを提案できるようになります。また、安全なプロトタイピングとマルチランゲージなコード生成のために、ホストされたサーバーサイドのbashツールも利用可能です。
  • Structured Outputs: Google SearchによるグラウンディングとURLコンテキストを、構造化出力と組み合わせることが可能になり、後続のエージェンティックなタスクのために特定の形式へデータを抽出することが容易になります。

Vibe Coding と迅速なプロトタイピング

Gemini 3 Proは、自然言語がアプリケーション開発の主要な構文となる「vibe coding」を可能にします。このモデルはWebDev Arenaリーダーボードで1487 Eloを記録しており、単一のプロンプトからハイレベルなアイデアをインタラクティブなアプリケーションに変換する能力を反映しています。

Google AI Studio Build Mode

Google AI StudioのBuildモードを使用すると、モデルとAPIを自動的に接続することで、プロンプトからAIネイティブなアプリへ迅速に移行できます。モデルの向上した指示追従性により、単一のプロンプト、ボイスメモ、または手書きのスケッチから、レトロゲームやインタラクティブなランディングページなどの完全に機能するアプリを作成できます。

マルチモーダル理解と空間推論

Gemini 3 Proは、複雑なマルチモーダル理解における主要なモデルとして位置付けられており、MMMU-Pro(画像推論)およびVideo MMMU(ビデオ理解)で新しいベンチマークを樹立しています。100万トークンのコンテキストウィンドウを備えています。

視覚的および空間的推論

  • ドキュメント理解: モデルはOCRを超え、複雑なドキュメントに対するインテリジェントな推論を提供します。
  • 空間理解: Gemini 3 Proは、軌道予測やポインティングを含むエンボディド推論(embodied reasoning)タスクに優れており、これらは自動運転車、ロボット工学、XRデバイスに適用可能です。
  • スクリーン理解: モデルは、マウスの動きや画面上の注釈から派生するユーザーの意図を含む、デスクトップおよびモバイルOSの画面を解釈し、コンピュータ操作エージェントを駆動できます。

ビデオ推論

Gemini 3 Proは、素早いアクションを捉えるための高フレームレート理解をサポートし、長時間の映像にわたるナラティブを合成するためにロングコンテキスト・リコールを活用します。OpusClipのCTOであるJay Wu氏によると、このモデルはビデオエージェントの推論とツール呼び出しにおいて、以前の実装よりも32%のスピード向上を実現しています。

技術仕様と可用性

Gemini 3 Proは、Google AI StudioのGemini API、および企業向けにはVertex AIを通じてプレビュー版として利用可能です。

200kトークン以下のプロンプトの料金:

  • 入力: $2/100万トークン
  • 出力: $12/100万トークン

APIコントロール: より深い推論をサポートするために、APIには新しい思考レベル(thinking level)パラメータ、マルチモーダル・ビジョン処理のための詳細なメディア解像度設定、およびマルチターン会話全体でコンテキストを維持するための思考シグネチャ(thought signatures)に対する厳格な検証が含まれています。

Sources