pipecat-ai/pipecat
Open Source framework for voice agents, multimodal apps, and realtime AI. Maintained by Daily and the community.
解決的問題
Pipecat 是一個專為簡化即時、多模態對話式 AI 代理建構而設計的框架。它消除了協調音訊、影像與 AI 服務的複雜性,讓開發者能從簡單的語音助理,到可在不同流程或機器間協調的複雜多代理系統,皆能輕鬆建構。
工作原理
Pipecat 採用模組化、可組合的管道架構。每個代理皆以管道形式呈現,整合可插入的服務,如語音轉文字(STT)、大型語言模型(LLMs)、文字轉語音(TTS),或直接的語音轉語音服務。這些管道可組合以實現專家代理間的交接、平行執行(扇出),或邊車工作模式,同時透過 WebRTC 與 WebSocket 等傳輸方式,維持超低延遲。
適用對象
適用於開發以語音為首的 AI 應用程式之開發者,例如 AI 伴侶、業務支援機器人、互動式敘事工具,以及複雜的對話系統。
主要亮點
- 多代理編排:支援交接、平行扇出,以及透過共享總線的分散式部署。
- 語音優先整合:內建支援大量 STT、LLM 與 TTS 提供商。
- 即時性能:針對超低延遲互動進行最佳化。
- 豐富的生態系:包含多個平台(JS、React、Swift、Kotlin、C++)的客戶端 SDK、專案架構用 CLI,以及即時除錯工具(Whisker)。
相關
- 專案
pipecat-ai/pipecat-examplesA collection of intermediate and advanced example applications demonstrating how to build voice and multimodal AI agents using the Pipecat framework.
- 專案
- 專案
uezo/aiavatarkitA modular framework for building ultra-low latency conversational AI avatars that integrate VAD, STT, LLM, and TTS across multiple channels like web, phone, and hardware.
- 專案
livekit/agents用於構建即時、可編程的多模態 AI 代理人之框架,這些代理人可以看、聽和說話,並具有集成的任務調度與電話支援功能。
- 專案
huggingface/speech-to-speechSpeech‑to‑Speech 是 Hugging Face 的開源管道,將語音輸入轉換為語音輸出。它串接 VAD → STT → LLM → TTS,每個元件均可替換(Silero VAD、Parakeet/Faster‑Whisper/Whisper STT、任何 OpenAI 相容 LLM 或本機 Transformers/MLX 模型、Qwen3‑TTS 或其他 TTS 後端)。整個系統透過 WebSocket/WebRTC 實作 OpenAI Realtime 協定,因此現有的 OpenAI Agents SDK 代碼可直接使用。透過單一 `pip install speech-to-speech` 安裝後,執行 `speech-to-speech serve`(伺服器)和 `speech-to-speech talk`(客戶端)或 `speech-to-speech local`(兩者一起)。支援純本機運行、本機/託管 LLM 混合、Docker 部署,以及可選擴充以使用替代 TTS/STT 模型。專為語音助手機器人(如 Reachy Mini)和低延遲語音 AI 應用設計。