NVIDIA-AI-IOT/live-vlm-webui
Real-time Vision Language Model interaction via webcam - WebRTC-based web interface
它解决了什么问题
Live VLM WebUI 提供了一个通用的网页界面,用于实时与视觉语言模型(VLMs)交互。它解决了将实时视频流(如网络摄像头或IP摄像头)传输到各种VLM后端的难题,从而实现在不同硬件平台上对AI驱动的分析、基准测试和性能测试的即时处理。
它如何工作
该工具充当视频源与VLM后端之间的接口。它通过WebRTC或RTSP捕获实时流,并将帧发送到配置好的VLM API(如Ollama、vLLM或NVIDIA NIM)。系统采用异步处理,确保视频流保持流畅,同时AI在后台处理帧。它还包含内置的系统监控功能,用于跟踪GPU/CPU使用率和推理延迟。
适合谁使用
专为从事视觉AI、机器人和工业自动化领域的开发人员、AI研究人员和工程师设计,他们需要一种快速在不同硬件(包括NVIDIA Jetson、DGX和标准PC)上测试和基准测试各种VLM的方法。
主要特性
- 通用API支持:兼容OpenAI兼容的API,包括Ollama、vLLM、SGLang和NVIDIA NIM。
- 实时监控:集成的实时GPU利用率、VRAM、CPU和RAM跟踪,配有折线图。
- 多源输入:支持WebRTC网络摄像头流和RTSP IP摄像头。
- 跨平台:支持x86_64和ARM64架构,包括Jetson Orin和Thor等专用硬件。
- 交互式提示:内置提示编辑器,提供超过10个预设提示,适用于OCR和目标检测等任务。
相关
- 项目
- 项目
- 项目
- 项目
- 项目