GetStream/Vision-Agents

Open Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Stream's edge network for ultra-low latency.

What it solves

Vision Agents는 실시간으로 "보고, 듣고, 말할" 수 있는 저지연·멀티모달 AI 에이전트를 구축하기 위한 프레임워크를 제공합니다. 실시간 비디오 스트리밍(WebRTC)과 대형 언어 모델(LLM) 및 YOLO와 같은 특수 컴퓨터 비전 모델을 결합하는 어려움을 해결하여, 눈에 띄는 지연 없이 인터랙티브한 시각 AI 경험을 만들 수 있습니다.

How it works

이 프로젝트는 플러그 가능한 아키텍처를 사용하여 개발자가 비디오를 직접 모델 제공자에게 스트리밍할 수 있게 합니다. YOLO, Roboflow 및 커스텀 PyTorch/ONNX 모델을 지원하는 비디오 처리 파이프라인을 Gemini, OpenAI, Claude와 같은 LLM의 네이티브 API와 결합합니다. 또한 다양한 STT(음성‑텍스트) 및 TTS(텍스트‑음성) 제공자를 통합해 회전 감지와 음성‑음성 상호작용을 포함한 자연스러운 대화 흐름을 처리합니다.

Who it’s for

실시간 AI 애플리케이션을 개발하는 개발자를 위한 것입니다. 예시로 AI 스포츠 코칭, 드론 화재 감지, 물리 치료 보조, 가상 피팅, 자동 보안 모니터링 등이 있습니다.

Highlights

  • Ultra-low latency: Stream의 엣지 네트워크를 사용해 오디오/비디오 지연을 30 ms 이하로 유지합니다.
  • Multi-modal integration: 특화된 CV 모델과 범용 LLM을 매끄럽게 결합합니다.
  • Extensible pipeline: 프레임별 이해를 가능하게 하는 플러그 가능한 프로세서.
  • Broad ecosystem: React, Android, iOS, Flutter, Unity용 네이티브 SDK 제공.
  • Production-ready: 내장 HTTP 서버, Prometheus 메트릭, Kubernetes 배포 지원 포함.
  • Advanced capabilities: RAG, MCP를 통한 툴 호출, Twilio 또는 Telnyx를 이용한 양방향 전화 통합 지원.