Gemini 에이전트 기반 비디오 이해 출시
Google DeepMind는 Gemini 3.7 Flash, 3.6 Flash 및 3.5 Flash-Lite를 위한 에이전트 기반 비디오 이해를 도입했습니다. 이 기능은 정적 프레임 속도 처리를 동적으로 비디오 세그먼트를 검색하고 검사하는 목표 지향적 에이전트 루프로 대체하여 토큰 소비를 최대 88%, 비용을 최대 66% 줄이는 동시에 정확도를 최대 7% 향상시킵니다.
동적 처리 vs. 정적 분석
에이전트 기반 비디오 이해는 비디오 분석을 고정된 초당 프레임 수(FPS) 수집 모델에서 동적인 도구 기반 접근 방식으로 전환합니다. 표준 정적 처리에서 모델은 고정된 속도(기본값 1 FPS)로 비디오를 수집합니다. 반면, 에이전트 기반 비디오 이해는 Gemini가 무엇을 볼지, 재생 속도, 사용할 모달리티(시각적 프레임, 오디오, 전사 포함)를 능동적으로 결정하여 쿼리에 답하는 데 필요한 신호만 가져올 수 있도록 합니다.
이 접근 방식은 내부 도구를 통해 관련 비디오 세그먼트를 로드하는 프로세스를 자동화하여 개발 오버헤드를 줄입니다. 이 작업은 이전에 개발자가 수동으로 구현해야 했던 작업이었습니다.
성능 벤치마크 및 효율성
표준 비디오 분석 벤치마크 전반에 걸쳐, 에이전트 기반 접근 방식은 특히 여러 시간 길이의 녹화본, 90분 강의, 10분 분량의 사용 가이드와 같은 긴 형식의 콘텐츠에 대해 상당한 효율성 향상을 제공합니다.
주요 성능 지표는 다음과 같습니다:
- 토큰 소비: 최대 88% 감소.
- 분석 비용: 최대 66% 감소.
- 정확도: 최대 7% 향상.
Gemini 3.7 Flash는 최고의 전반적인 품질과 품질 및 비용의 가장 효율적인 조합을 제공하는 모델로 확인되었으며, 비디오 분석을 위한 정확도 대비 비용 파레토 프론티어에 위치하고 있습니다.
핵심 기능 및 사용 사례
에이전트 기반 비디오 이해는 정적 1 FPS 처리에서는 불가능하거나 비용이 너무 많이 드는 고정밀 작업을 가능하게 합니다:
- 1초 미만 순간 검색: 자동화된 비디오 편집을 위해 찰나의 상태 변화 및 정확한 컷 경계를 정확히 찾아내는 기능.
- 긴 형식의 건초더미에서 바늘 찾기 검색: 수백만 개의 토큰을 소모하지 않고 여러 시간 길이의 비디오에서 복잡한 쿼리를 실행.
- 이상 탐지: 미세한 시각적 아티팩트 및 빠른 움직임을 검사하기 위해 특정 시간대를 더 높은 FPS로 리샘플링하는 기능.
- 액션 및 객체 카운팅: 시간 경과에 따른 반복적인 물리적 움직임과 뚜렷한 객체의 정밀한 추적.
가용성 및 구현
에이전트 기반 비디오 이해는 Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform을 통해 사용할 수 있습니다. Gemini 3.7 Flash, 3.6 Flash 및 3.5 Flash-Lite에 통합되었으며 추가 기능 요금 없이 표준 Gemini API 토큰 가격을 따릅니다.
개발자는 API 구성에서 processing 매개변수를 "agentic"로 설정하여 이 기능을 활성화할 수 있습니다.
API 외에도 이 기술은 Flash 및 Flash-Lite 모델에 걸쳐 Gemini 앱에 통합되고 있으며, 향후 몇 달 내로 비디오 시청 페이지의 "Ask YouTube" 기능을 지원할 예정입니다.