Gemini 代理式影片理解發佈
Google DeepMind 已為 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 推出代理式影片理解(agentic video understanding)功能。此功能將靜態幀率處理替換為目標導向的代理迴圈(agentic loop),能動態搜尋並檢查影片片段,在提高準確度高達 7% 的同時,減少高達 88% 的 Token 消耗量與高達 66% 的成本。
Dynamic Processing vs. Static Analysis
代理式影片理解將影片分析從固定的每秒幀數(FPS)攝取模型轉向動態、基於工具的方法。在標準的靜態處理中,模型以固定速率(預設為 1 FPS)攝取影片。相比之下,代理式影片理解允許 Gemini 動態決定要觀看的部分、播放速度以及要使用的模態(包括視覺幀、音訊與逐字稿),僅擷取回答問題所需的必要訊號。
這種方法透過內部工具自動化載入相關影片片段的過程,降低了開發開銷,而這項任務先前需要開發者手動實作。
Performance Benchmarks and Efficiency
在標準影片分析基準測試中,代理式方法提供了顯著的效率提升,特別是針對長篇內容,例如數小時的錄影、90 分鐘的講座與 10 分鐘的教學指南。
關鍵效能指標包括:
- Token Consumption: 減少高達 88%。
- Analysis Costs: 減少高達 66%。
- Accuracy: 提高高達 7%。
Gemini 3.7 Flash 被認為是提供最佳整體品質,且在品質與成本之間達到最高效率組合的模型,使其在影片分析的準確度與成本 Pareto 前沿(pareto frontier)中佔據優勢。
Core Capabilities and Use Cases
代理式影片理解可實現高精度的任務,這些任務在靜態 1 FPS 處理下通常是不可能或成本過高的:
- Sub-second Moment Retrieval: 能精確定位毫秒級的狀態變化與緊湊的剪輯邊界,用於自動化影片編輯。
- Long-form Needle-in-a-Haystack Search: 在不消耗數百萬 Token 的情況下,對數小時的影片進行複雜查詢。
- Anomaly Detection: 能以更高的 FPS 對特定時間窗口進行重新採樣,以檢查細微的視覺偽影與快速運動。
- Counting Actions and Objects: 精確追蹤隨時間變化的重複性肢體動作與不同物件。
Availability and Implementation
代理式影片理解已透過 Google AI Studio 中的 Gemini API 與 Gemini Enterprise Agent Platform 提供。它已整合至 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 中,並遵循標準 Gemini API Token 價格,不需額外功能費用。
開發者可以透過在 API 配置中將 processing 參數設定為 `