pipecat-ai/pipecat
Open Source framework for voice agents, multimodal apps, and realtime AI. Maintained by Daily and the community.
解决的问题
Pipecat 是一个旨在简化实时、多模态对话式 AI 代理构建的框架。它消除了协调音频、视频和 AI 服务的复杂性,使开发者能够从简单的语音助手构建到复杂的多代理系统,这些系统可以在不同进程或机器之间进行协调。
工作原理
Pipecat 使用模块化、可组合的管道架构。每个代理都表示为一个管道,该管道集成了可插拔的服务,用于语音转文字(STT)、大型语言模型(LLMs)和文字转语音(TTS),或直接的语音转语音服务。这些管道可以组合以实现专家代理之间的交接、并行执行(扇出)或边车工作模式,同时通过 WebRTC 和 WebSocket 等传输方式保持超低延迟。
适用人群
适用于构建以语音为先的 AI 应用程序的开发者,例如 AI 伴侣、业务支持机器人、互动叙事工具和复杂的对话系统。
主要亮点
- 多代理编排:支持交接、并行扇出和通过共享总线的分布式部署。
- 语音优先集成:内置对大量 STT、LLM 和 TTS 提供商的支持。
- 实时性能:针对超低延迟交互进行了优化。
- 丰富的生态系统:包含多个平台(JS、React、Swift、Kotlin、C++)的客户端 SDK、用于项目脚手架的 CLI,以及实时调试器(Whisker)。
相关
- 项目
pipecat-ai/pipecat-examplesA collection of intermediate and advanced example applications demonstrating how to build voice and multimodal AI agents using the Pipecat framework.
- 项目
- 项目
uezo/aiavatarkitA modular framework for building ultra-low latency conversational AI avatars that integrate VAD, STT, LLM, and TTS across multiple channels like web, phone, and hardware.
- 项目
livekit/agents用于构建实时、可编程的多模态 AI 智能体的框架,这些智能体可以看、听和说话,并具有集成的任务调度和电话支持功能。
- 项目
huggingface/speech-to-speechSpeech‑to‑Speech 是 Hugging Face 的开源管道,将语音输入转换为语音输出。它串联 VAD → STT → LLM → TTS,每个组件均可替换(Silero VAD、Parakeet/Faster‑Whisper/Whisper STT、任何 OpenAI 兼容 LLM 或本地 Transformers/MLX 模型、Qwen3‑TTS 或其他 TTS 后端)。整个系统通过 WebSocket/WebRTC 实现 OpenAI Realtime 协议,因此现有的 OpenAI Agents SDK 代码可直接使用。通过单个 `pip install speech-to-speech` 安装后,运行 `speech-to-speech serve`(服务器)和 `speech-to-speech talk`(客户端)或 `speech-to-speech local`(两者一起)。支持纯本地运行、本地/托管 LLM 混合、Docker 部署,以及可选扩展以使用替代 TTS/STT 模型。专为语音助手机器人(如 Reachy Mini)和低延迟语音 AI 应用设计。