NVIDIA-AI-IOT/live-vlm-webui

Real-time Vision Language Model interaction via webcam - WebRTC-based web interface

它解决了什么问题

Live VLM WebUI 提供了一个通用的网页界面,用于实时与视觉语言模型(VLMs)交互。它解决了将实时视频流(如网络摄像头或IP摄像头)传输到各种VLM后端的难题,从而实现在不同硬件平台上对AI驱动的分析、基准测试和性能测试的即时处理。

它如何工作

该工具充当视频源与VLM后端之间的接口。它通过WebRTC或RTSP捕获实时流,并将帧发送到配置好的VLM API(如Ollama、vLLM或NVIDIA NIM)。系统采用异步处理,确保视频流保持流畅,同时AI在后台处理帧。它还包含内置的系统监控功能,用于跟踪GPU/CPU使用率和推理延迟。

适合谁使用

专为从事视觉AI、机器人和工业自动化领域的开发人员、AI研究人员和工程师设计,他们需要一种快速在不同硬件(包括NVIDIA Jetson、DGX和标准PC)上测试和基准测试各种VLM的方法。

主要特性

  • 通用API支持:兼容OpenAI兼容的API,包括Ollama、vLLM、SGLang和NVIDIA NIM。
  • 实时监控:集成的实时GPU利用率、VRAM、CPU和RAM跟踪,配有折线图。
  • 多源输入:支持WebRTC网络摄像头流和RTSP IP摄像头。
  • 跨平台:支持x86_64和ARM64架构,包括Jetson Orin和Thor等专用硬件。
  • 交互式提示:内置提示编辑器,提供超过10个预设提示,适用于OCR和目标检测等任务。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目