GetStream/Vision-Agents

Open Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Stream's edge network for ultra-low latency.

What it solves

Vision Agents は、リアルタイムで「見る・聞く・話す」ことができる低遅延・マルチモーダル AI エージェントを構築するためのフレームワークです。リアルタイムビデオストリーミング(WebRTC)と大規模言語モデル(LLM)および YOLO などの専門的なコンピュータビジョンモデルを組み合わせる難しさを解決し、顕著な遅延なしにインタラクティブなビジュアル AI 体験を実現します。

How it works

本プロジェクトはプラガブルアーキテクチャを採用し、開発者がビデオを直接モデルプロバイダーへストリーミングできるようにします。YOLO、Roboflow、カスタム PyTorch/ONNX モデルをサポートするビデオ処理パイプラインと、Gemini、OpenAI、Claude などの LLM のネイティブ API 統合を組み合わせます。また、音声認識(STT)および音声合成(TTS)プロバイダーと連携し、ターン検出や音声対音声インタラクションを含む自然な会話フローを処理します。

Who it’s for

リアルタイム AI アプリケーションを構築する開発者向けです。例として AI スポーツコーチング、ドローンによる火災検知、理学療法アシスタント、バーチャル試着、そして自動化されたセキュリティ監視などがあります。

Highlights

  • Ultra-low latency: Stream のエッジネットワークを使用し、音声/映像遅延を 30 ms 未満に保ちます。
  • Multi-modal integration: 専門的な CV モデルと汎用 LLM をシームレスに統合。
  • Extensible pipeline: フレーム単位の理解を可能にするプラガブルプロセッサ。
  • Broad ecosystem: React、Android、iOS、Flutter、Unity 向けのネイティブ SDK を提供。
  • Production-ready: 組み込み HTTP サーバ、Prometheus メトリクス、Kubernetes デプロイ支援を含む。
  • Advanced capabilities: RAG、MCP を介したツール呼び出し、Twilio または Telnyx を用いた双方向電話統合をサポート。