NVIDIA-AI-Blueprints/video-search-and-summarization

NVIDIA AI Blueprint for video search and summarization (VSS) is a GPU-accelerated reference architecture for building video analytics agents with real-time verified alerts, visual Q&A, and automated reporting. The VSS Blueprint uses vision language models (VLMs) such as NVIDIA Cosmos, LLMs such as NVIDIA Nemotron, RAG, and NVIDIA NIMs.

解決する課題

このプロジェクトは、大量の保存済みおよびストリーミングビデオデータの分析とインタラクションの難しさを解決します。スマートスペースや倉庫などの環境において、自然言語検索、長い録画の要約、およびリアルタイムの警告検証を実行できるビジョンAIエージェントの作成を可能にし、運用効率を向上させます。

仕組み

システムは、ビジョンマイクロサービス、視覚言語モデル (VLM)、および大規模言語モデル (LLM) を組み合わせた階層型アーキテクチャを使用しています:

  • リアルタイム・ビデオ・インテリジェンス: ライブストリームから視覚的特徴、セマンティック埋め込み、および文脈的理解を抽出し、メッセージブローカーにパブリッシュします。
  • ダウンストリーム分析: 生の検知結果を、軌跡、インシデント、検証済みアラートなどの実行可能なインサイトに変換します。
  • エージェントによる処理: トップレベルのエージェントが Model Context Protocol (MCP) を使用して、ビデオ分析データと、Q&A、セマンティック検索、クリップ取得のためのツールにアクセスします。

対象者

  • ビデオアナリストおよびITエンジニア: 1クリックデプロイメントを通じてビデオデータの処理と要約を行う、すぐに展開可能なソリューションを必要とする方。
  • GenAIデベロッパーおよびMLエンジニア: 特定のデータセットに合わせてパイプラインをカスタマイズしたり、特定のユースケースに合わせてLLMを微調整したりすることを検討しているエキスパート。

ハイライト

  • 多様なエージェントワークフロー: チャンキングと高密度キャプション作成による、Q&Aレポート生成、リアルタイム異常検知、および長尺ビデオの要約をサポートします。
  • VLMベースの検証: 知覚モデルによって生成されたアラートを検証するためにVLMを使用し、誤検知を削減します。
  • セマンティック検索: ビデオ埋め込みを使用して、ビデオアーカイブ全体に対して自然言語検索を可能にします。
  • NVIDIA NIMの統合: Cosmos3 Nano Reasoner や Nemotron-Nano-9B-v2 のような最適化されたマイクロサービスを活用します。