NVIDIA-AI-Blueprints/video-search-and-summarization
NVIDIA AI Blueprint for video search and summarization (VSS) is a GPU-accelerated reference architecture for building video analytics agents with real-time verified alerts, visual Q&A, and automated reporting. The VSS Blueprint uses vision language models (VLMs) such as NVIDIA Cosmos, LLMs such as NVIDIA Nemotron, RAG, and NVIDIA NIMs.
해결하는 문제
이 프로젝트는 대량의 저장 및 스트리밍 비디오 데이터를 분석하고 상호작용하는 데 따르는 어려움을 해결합니다. 스마트 공간 및 창고와 같은 환경에서 운영 효율성을 높이기 위해 자연어 검색, 긴 녹화물 요약 및 실시간 경보 검증을 수행할 수 있는 비전 AI 에이전트 생성을 가능하게 합니다.
작동 방식
시스템은 비전 마이크로서비스, 시각 언어 모델(VLM) 및 대규모 언어 모델(LLM)을 결합한 계층형 아키텍처를 사용합니다:
- 실시간 비디오 인텔리전스: 라이브 스트림에서 시각적 특징, 시맨틱 임베딩 및 문맥적 이해를 추출하여 메시지 브로커에 게시합니다.
- 다운스트림 분석: 원시 탐지 데이터를 궤적, 사건 및 검증된 경보와 같은 실행 가능한 인사이트로 변환합니다.
- 에이전트 기반 처리: 최상위 에이전트가 Model Context Protocol (MCP)를 사용하여 비디오 분석 데이터 및 Q&A, 시맨틱 검색, 클립 검색을 위한 도구에 액세스합니다.
대상 사용자
- 비디오 분석가 및 IT 엔지니어: 1클릭 배포를 통해 비디오 데이터를 처리하고 요약할 수 있는 즉시 배포 가능한 솔루션이 필요한 사용자.
- GenAI 개발자 및 ML 엔지니어: 특정 데이터 세트에 맞춰 파이프라인을 커스텀하거나 특정 유스케이스를 위해 LLM을 미세 조정하려는 전문가.
주요 특징
- 다양한 에이전트 워크플로우: 청킹(chunking) 및 밀집 캡셔닝(dense captioning)을 통한 Q&A 보고서 생성, 실시간 이상 탐지 및 긴 비디오 요약을 지원합니다.
- VLM 기반 검증: 인지 모델이 생성한 경보의 오탐지를 줄이기 위해 VLM을 사용하여 경보를 검증합니다.
- 시맨틱 검색: 비디오 임베딩을 사용하여 비디오 아카이브 전체에서 자연어 검색을 가능하게 합니다.
- NVIDIA NIM 통합: Cosmos3 Nano Reasoner 및 Nemotron-Nano-9B-v2와 같은 최적화된 마이크로서비스를 활용합니다.