GetStream/Vision-Agents

Open Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Stream's edge network for ultra-low latency.

What it solves

Vision Agents 提供一个框架,用于构建能够实时“看、听、说”的低延迟、多模态 AI 代理。它解决了将实时视频流(WebRTC)与大型语言模型(LLM)以及专门的计算机视觉模型(如 YOLO)结合的难题,从而在不产生显著延迟的情况下创建交互式视觉 AI 体验。

How it works

该项目使用可插拔的架构,允许开发者直接将视频流传输到模型提供商。它将视频处理管线(支持 YOLO、Roboflow 和自定义 PyTorch/ONNX 模型)与 LLM(如 Gemini、OpenAI、Claude)的原生 API 集成,并结合多种语音转文字(STT)和文字转语音(TTS)服务,以处理自然对话流程,包括回合检测和语音对语音交互。

Who it’s for

适用于构建实时 AI 应用的开发者,例如 AI 体育教练、无人机火灾检测、物理治疗助理、虚拟试穿以及自动化安全监控等。

Highlights

  • Ultra-low latency: 使用 Stream 的边缘网络将音视频延迟保持在 30 ms 以下。
  • Multi-modal integration: 无缝结合专业的计算机视觉模型与通用的大型语言模型。
  • Extensible pipeline: 可插拔的处理器支持逐帧理解。
  • Broad ecosystem: 原生 SDK 支持 React、Android、iOS、Flutter 与 Unity。
  • Production-ready: 包含内置 HTTP 服务器、Prometheus 指标和 Kubernetes 部署支持。
  • Advanced capabilities: 支持 RAG、通过 MCP 的工具调用,以及通过 Twilio 或 Telnyx 的双向电话集成。