GetStream/Vision-Agents

Open Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Stream's edge network for ultra-low latency.

What it solves

Vision Agents 提供一個框架,用於構建能即時「看、聽、說」的低延遲、多模態 AI 代理。它解決了將即時視訊串流(WebRTC)與大型語言模型(LLM)以及專門的電腦視覺模型(如 YOLO)結合的困難,從而在不產生顯著延遲的情況下創造互動式視覺 AI 體驗。

How it works

此專案採用可插拔的架構,允許開發者直接將視訊串流傳送至模型提供者。它將視訊處理管線(支援 YOLO、Roboflow 與自訂 PyTorch/ONNX 模型)與 LLM(如 Gemini、OpenAI、Claude)的原生 API 整合,同時結合多種語音轉文字(STT)與文字轉語音(TTS)服務,以處理自然對話流程,包括回合偵測與語音對語音互動。

Who it’s for

適用於開發即時 AI 應用的開發者,例如 AI 體育教練、無人機火災偵測、物理治療助理、虛擬試穿以及自動化安全監控等。

Highlights

  • Ultra-low latency: 使用 Stream 的邊緣網路將音訊/視訊延遲維持在 30 ms 以下。
  • Multi-modal integration: 無縫結合專業的電腦視覺模型與通用的大型語言模型。
  • Extensible pipeline: 可插拔的處理器支援逐幀理解。
  • Broad ecosystem: 原生 SDK 支援 React、Android、iOS、Flutter 與 Unity。
  • Production-ready: 內建 HTTP 伺服器、Prometheus 指標與 Kubernetes 部署支援。
  • Advanced capabilities: 支援 RAG、透過 MCP 的工具呼叫,以及透過 Twilio 或 Telnyx 的雙向電話整合。