NVIDIA-AI-Blueprints/video-search-and-summarization

NVIDIA AI Blueprint for video search and summarization (VSS) is a GPU-accelerated reference architecture for building video analytics agents with real-time verified alerts, visual Q&A, and automated reporting. The VSS Blueprint uses vision language models (VLMs) such as NVIDIA Cosmos, LLMs such as NVIDIA Nemotron, RAG, and NVIDIA NIMs.

NVIDIA AI Blueprint – Video Search & Summarization (VSS)

这是什么 – 一个参考实现,展示如何构建 GPU 加速的视频 AI 代理,能够使用自然语言查询对实时或录制的视频进行搜索、分析、摘要和推理。它将视觉语言模型 (VLM)、大型语言模型 (LLM)、检索增强生成 (RAG) 和 NVIDIA NIM 微服务整合在一起。

主要功能

  • 自然语言视频搜索 – 使用密集嵌入索引视频流,并通过文本查询检索相关片段。
  • 长视频摘要 – 将数小时的视频分块,生成密集字幕,并将它们汇总成简洁的摘要。
  • 视觉问答与报告生成 – 询问关于视频片段的问题;VLM 会生成答案和格式化的报告。
  • 实时警报验证 – 对象检测与跟踪管道会引发警报;VLM 会验证它们以减少误报。
  • 模块化微服务堆栈 – 用于实时特征提取、下游分析和代理编排离线工具的独立服务。

组织架构

层级 角色
实时视频智能 从流中提取视觉特征、嵌入和元数据;发布到消息代理。
下游分析 丰富元数据(行为分析、事件检测)并将结果存储在 Elasticsearch/Redis 中。
代理与离线处理 通过模型上下文协议 (MCP) 编排工具,以执行搜索、问答、摘要和片段检索。

主要组件

  • NIM 微服务 – 预构建的 NVIDIA 模型,例如 Cosmos3 Nano Reasoner 和 Nemotron-Nano-9B-v2。
  • services/agent/ – Python 代理代码(工具、API、嵌入、评估器)。
  • services/ui/ – 用于与代理交互的 Next.js 前端。
  • services/analytics/ – Python 和 Node.js 管道,将原始视频分析转换为可搜索的事件。
  • deploy/ – Docker-Compose 文件、Helm 图表和 Brev 启动脚本,用于在云端或本地硬件上快速部署。
  • tools/ – Redis/Kafka 流的消费者、logstash 插件,以及用于数据集生成和校准的实用程序。
  • skills/ – 与 Agentskills 兼容的技能包,可让其他代理调用 VSS 功能。

适用对象

  • 视频分析师 / IT 工程师,需要可用于视频分析和报告的即装即用解决方案。
  • GenAI / ML 工程师,想要自定义管道、替换模型,或将 VSS 集成到更大的视觉代理系统中。

入门指南

  1. 先决条件 – NVIDIA AI Enterprise 许可证、NIM 模型的 API 密钥、兼容的 GPU(确切的 GPU 列表请参见 NVIDIA 文档)。
  2. 快速启动选项
    • 可启动 (Brev) 部署 – 运行一个 Notebook,在 AWS 上启动 2×RTX PRO 6000 SE 实例并自动部署整个堆栈。
    • Docker-Compose 部署 – 安装 Docker Engine (28.3.3 – < 29.5.0)、NVIDIA Container Toolkit,并在 Ubuntu 22.04/24.04、DGX 或 Jetson 平台上运行提供的 compose.yml
  3. 请按照官方文档中的分步指南操作:https://docs.nvidia.com/vss/latest/quickstart.html

文档与演示

许可证 – 请参见仓库的 LICENSE 文件(标准 NVIDIA 开源条款)。


所有细节均直接取自仓库的 README;未推断任何额外功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目