Gemini 代理式影片理解發佈

Google DeepMind 已為 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 推出代理式影片理解(agentic video understanding)功能。此功能將靜態幀率處理替換為目標導向的代理迴圈(agentic loop),能動態搜尋並檢查影片片段,在提高準確度高達 7% 的同時,減少高達 88% 的 Token 消耗量與高達 66% 的成本。

Dynamic Processing vs. Static Analysis

代理式影片理解將影片分析從固定的每秒幀數(FPS)攝取模型轉向動態、基於工具的方法。在標準的靜態處理中,模型以固定速率(預設為 1 FPS)攝取影片。相比之下,代理式影片理解允許 Gemini 動態決定要觀看的部分、播放速度以及要使用的模態(包括視覺幀、音訊與逐字稿),僅擷取回答問題所需的必要訊號。

這種方法透過內部工具自動化載入相關影片片段的過程,降低了開發開銷,而這項任務先前需要開發者手動實作。

Performance Benchmarks and Efficiency

在標準影片分析基準測試中,代理式方法提供了顯著的效率提升,特別是針對長篇內容,例如數小時的錄影、90 分鐘的講座與 10 分鐘的教學指南。

關鍵效能指標包括:

  • Token Consumption: 減少高達 88%。
  • Analysis Costs: 減少高達 66%。
  • Accuracy: 提高高達 7%。

Gemini 3.7 Flash 被認為是提供最佳整體品質,且在品質與成本之間達到最高效率組合的模型,使其在影片分析的準確度與成本 Pareto 前沿(pareto frontier)中佔據優勢。

Core Capabilities and Use Cases

代理式影片理解可實現高精度的任務,這些任務在靜態 1 FPS 處理下通常是不可能或成本過高的:

  • Sub-second Moment Retrieval: 能精確定位毫秒級的狀態變化與緊湊的剪輯邊界,用於自動化影片編輯。
  • Long-form Needle-in-a-Haystack Search: 在不消耗數百萬 Token 的情況下,對數小時的影片進行複雜查詢。
  • Anomaly Detection: 能以更高的 FPS 對特定時間窗口進行重新採樣,以檢查細微的視覺偽影與快速運動。
  • Counting Actions and Objects: 精確追蹤隨時間變化的重複性肢體動作與不同物件。

Availability and Implementation

代理式影片理解已透過 Google AI Studio 中的 Gemini API 與 Gemini Enterprise Agent Platform 提供。它已整合至 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 中,並遵循標準 Gemini API Token 價格,不需額外功能費用。

開發者可以透過在 API 配置中將 processing 參數設定為 `

Sources