GetStream/Vision-Agents
Open Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Stream's edge network for ultra-low latency.
What it solves
Vision Agents は、リアルタイムで「見る・聞く・話す」ことができる低遅延・マルチモーダル AI エージェントを構築するためのフレームワークです。リアルタイムビデオストリーミング(WebRTC)と大規模言語モデル(LLM)および YOLO などの専門的なコンピュータビジョンモデルを組み合わせる難しさを解決し、顕著な遅延なしにインタラクティブなビジュアル AI 体験を実現します。
How it works
本プロジェクトはプラガブルアーキテクチャを採用し、開発者がビデオを直接モデルプロバイダーへストリーミングできるようにします。YOLO、Roboflow、カスタム PyTorch/ONNX モデルをサポートするビデオ処理パイプラインと、Gemini、OpenAI、Claude などの LLM のネイティブ API 統合を組み合わせます。また、音声認識(STT)および音声合成(TTS)プロバイダーと連携し、ターン検出や音声対音声インタラクションを含む自然な会話フローを処理します。
Who it’s for
リアルタイム AI アプリケーションを構築する開発者向けです。例として AI スポーツコーチング、ドローンによる火災検知、理学療法アシスタント、バーチャル試着、そして自動化されたセキュリティ監視などがあります。
Highlights
- Ultra-low latency: Stream のエッジネットワークを使用し、音声/映像遅延を 30 ms 未満に保ちます。
- Multi-modal integration: 専門的な CV モデルと汎用 LLM をシームレスに統合。
- Extensible pipeline: フレーム単位の理解を可能にするプラガブルプロセッサ。
- Broad ecosystem: React、Android、iOS、Flutter、Unity 向けのネイティブ SDK を提供。
- Production-ready: 組み込み HTTP サーバ、Prometheus メトリクス、Kubernetes デプロイ支援を含む。
- Advanced capabilities: RAG、MCP を介したツール呼び出し、Twilio または Telnyx を用いた双方向電話統合をサポート。