Gemini Agentic Video Understanding Release
Google DeepMindは、Gemini 3.7 Flash、3.6 Flash、および3.5 Flash-Lite向けに、エージェンティックなビデオ理解(agentic video understanding)を導入しました。この機能は、静的なフレームレート処理を、ビデオセグメントを動的に検索・検査する目標指向のエージェンティック・ループに置き換えるもので、トークン消費量を最大88%削減し、コストを最大66%削減しながら、精度を最大7%向上させます。
Dynamic Processing vs. Static Analysis
エージェンティックなビデオ理解は、ビデオ分析を固定のフレームレート(FPS)による取り込みモデルから、動的でツールベースのアプローチへと移行させます。標準的な静的処理では、モデルは固定レート(デフォルトは1 FPS)でビデオを取り込みます。対照的に、エージェンティックなビデオ理解では、Geminiが何を視聴すべきか、再生速度、および使用するモダリティ(視覚フレーム、音声、トランスクリプトを含む)を能動的に決定し、クエリに答えるために必要な信号のみを取得することができます。
このアプローチは、内部ツールを介して関連するビデオセグメントをロードするプロセスを自動化することで、開発オーバーヘッドを削減します。これは以前、開発者による手動の実装が必要なタスクでした。
Performance Benchmarks and Efficiency
標準的なビデオ分析ベンチマークにおいて、エージェンティックなアプローチは、数時間の録画、90分の講義、10分のハウツーガイドなどの長尺コンテンツにおいて、大幅な効率性の向上をもたらします。
主なパフォーマンス指標は以下の通りです:
- Token Consumption: 最大88%削減。
- Analysis Costs: 最大66%削減。
- Accuracy: 最大7%向上。
Gemini 3.7 Flashは、全体的な品質において最高の品質を提供し、品質とコストの最も効率的な組み合わせを実現するモデルとして特定されており、ビデオ分析における精度対コストのパレートの境界(pareto frontier)に位置しています。
Core Capabilities and Use Cases
エージェンティックなビデオ理解は、静的な1 FPS処理では不可能、あるいはコスト的に困難であった高精度なタスクを可能にします:
- Sub-second Moment Retrieval: 自動ビデオ編集のための、コンマ数秒のステート変化やタイトなカット境界を特定する能力。
- Long-form Needle-in-a-Haystack Search: 数百万のトークンを消費することなく、数時間のビデオ全体にわたって複雑なクエリを実行する能力。
- Anomaly Detection: 特定の時間窓をより高いFPSで再サンプリングして、微細な視覚的アーティファクトや急速な動きを検査する能力。
- Counting Actions and Objects: 時間経過に伴う繰り返しの物理的な動きや、明確なオブジェクトの正確な追跡。
Availability and Implementation
エージェンティックなビデオ理解は、Google AI StudioおよびGemini Enterprise Agent Platform経由のGemini APIで利用可能です。Gemini 3.7 Flash、3.6 Flash、および3.5 Flash-Liteに統合されており、標準的なGemini APIのトークン価格設定に従い、追加の機能料金はかかりません。
開発者は、API設定で processing パラメータを `