Gemini Agentic Video Understanding 发布
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出了智能体视频理解(agentic video understanding)功能。该能力将静态帧率处理替换为目标导向的智能体循环,能够动态搜索并检查视频片段,在将 token 消耗降低高达 88% 并将成本降低高达 66% 的同时,将准确率提高了高达 7%。
动态处理 vs. 静态分析
智能体视频理解将视频分析从固定的每秒帧数(FPS)摄取模型转变为基于工具的动态方法。在标准的静态处理中,模型以固定速率摄取视频(默认为 1 FPS)。相比之下,智能体视频理解允许 Gemini 积极地确定观看内容、播放速度以及要使用的模态——包括视觉帧、音频和转录文本——仅获取回答查询所需的必要信号。
这种方法通过使用内部工具自动加载相关视频片段的过程,降低了开发开销,而这项任务以前需要开发者进行手动实现。
性能基准测试与效率
在标准的视频分析基准测试中,智能体方法提供了显著的效率提升,特别是对于长篇内容,如数小时的录像、90 分钟的讲座和 10 分钟的教程指南。
关键性能指标包括:
- Token 消耗:降低高达 88%。
- 分析成本:降低高达 66%。
- 准确率:提高高达 7%。
Gemini 3.7 Flash 被确定为提供最佳整体质量以及质量与成本最高效组合的模型,使其处于视频分析准确率与成本的帕累托前沿(pareto frontier)。
核心能力与用例
智能体视频理解能够实现高精度任务,这些任务在静态 1 FPS 处理下通常是不可能或成本过高的:
- 亚秒级瞬间检索:能够为自动化视频编辑精准定位瞬间的状态变化和紧凑的剪辑边界。
- 长篇“大海捞针”搜索:在不消耗数百万 token 的情况下,在数小时的视频中执行复杂的查询。
- 异常检测:能够以更高的 FPS 对特定时间窗口进行重采样,以检查细微的视觉伪影和快速运动。
- 动作与物体计数:对重复的物理动作和随时间变化的清晰物体进行精确跟踪。
可用性与实现
智能体视频理解可通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 使用。它已集成到 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中,并遵循标准的 Gemini API token 计费方式,无需额外功能费。
开发者可以通过在 API 配置中将 processing 参数设置为 `