pipecat-ai/pipecat
Open Source framework for voice agents, multimodal apps, and realtime AI. Maintained by Daily and the community.
何を解決するか
Pipecat は、リアルタイムでマルチモーダルな会話型AIエージェントを構築しやすくするためのフレームワークです。音声、動画、AIサービスの調整の複雑さを解消し、開発者が単純な音声アシスタントから、異なるプロセスやマシン間で協調できる複雑なマルチエージェントシステムまで、あらゆるものを構築できるようにします。
動作方法
Pipecat はモジュール式で合成可能なパイプラインアーキテクチャを使用しています。各エージェントは、音声認識(STT)、大規模言語モデル(LLM)、音声合成(TTS)または直接の音声対音声サービスを統合するプラグイン可能なサービスを持つパイプラインとして表現されます。これらのパイプラインは、専門エージェント間の引き継ぎ、並列実行(ファンアウト)、サイドカー・ワーカーパターンを可能にするように組み合わせることができ、WebRTC や WebSocket などのトランスポートにより、極めて低遅延を維持します。
対象ユーザー
音声を最優先にしたAIアプリケーションを開発している開発者向けです。AIコンパニオン、ビジネスサポートボット、インタラクティブな物語作成ツール、複雑な対話システムなどが該当します。
特徴
- マルチエージェントの調整: 引き継ぎ、並列ファンアウト、共有バスを介した分散デプロイメントをサポート。
- 音声最優先の統合: 多数のSTT、LLM、TTSプロバイダーを内蔵サポート。
- リアルタイムパフォーマンス: 極めて低遅延な相互作用を最適化。
- 広範なエコシステム: 複数プラットフォーム(JS、React、Swift、Kotlin、C++)向けクライアントSDK、プロジェクトスケルトン用CLI、リアルタイムデバッガー(Whisker)を含む。
関連
- プロジェクト
pipecat-ai/pipecat-examplesA collection of intermediate and advanced example applications demonstrating how to build voice and multimodal AI agents using the Pipecat framework.
- プロジェクト
- プロジェクト
uezo/aiavatarkitA modular framework for building ultra-low latency conversational AI avatars that integrate VAD, STT, LLM, and TTS across multiple channels like web, phone, and hardware.
- プロジェクト
livekit/agents視覚、聴覚、発話が可能な、リアルタイムでプログラマブルなマルチモーダルAIエージェントを構築するためのフレームワーク。ジョブスケジューリングと電話接続のサポートを統合しています。
- プロジェクト
huggingface/speech-to-speechSpeech‑to‑Speech is a Hugging Face open‑source pipeline that turns spoken input into spoken output. It chains VAD → STT → LLM → TTS, each component being swappable (Silero VAD, Parakeet/Faster‑Whisper/Whisper STT, any OpenAI‑compatible LLM or local Transformers/MLX model, Qwen3‑TTS or other TTS back‑ends). The whole system speaks the OpenAI Realtime protocol over WebSocket/WebRTC, so existing OpenAI Agents SDK code works. Install with a single `pip install speech-to-speech`, then run `speech-to-speech serve` (server) and `speech-to-speech talk` (client) or `speech-to-speech local` (both together). It supports local‑only operation, mixed local/hosted LLMs, Docker deployment, and optional extras for alternative TTS/STT models. Designed for voice‑assistant robots (e.g., Reachy Mini) and low‑latency spoken AI applications.