bolna-ai/bolna
Conversational voice AI agents
解决的问题
Bolna 解决了构建生产级语音驱动对话助手时的复杂性。它处理将多个专业服务(如语音识别、大语言模型和文本转语音)编排成单一、连贯的对话流这一艰巨任务。
工作原理
该平台作为一个编排层,通过 websockets 连接不同的提供商。它通常遵循一个流水线:转录音频输入 (ASR)、通过 LLM 处理文本,并将响应合成回音频 (TTS)。它支持通过 Twilio 或 Plivo 等提供商进行电话集成,以实现真实的电话通话交互。
适用对象
专为寻求构建语音优先 AI 应用的开发者设计,范围涵盖从简单的纯文本助手到复杂的电话集成语音智能体。
亮点
- 多提供商支持:集成 ASR (Deepgram, Azure)、LLMs (OpenAI, Llama, Mistral) 和 TTS (ElevenLabs, AWS Polly, Cartesia)。
- 电话集成:支持通过 Twilio 和 Plivo 发起和管理通话。
- 灵活的编排:可以使用编程 Python 库或通过托管 API 使用。
- 端到端流水线:管理从音频输入到合成音频输出的完整生命周期。
- 可扩展架构:允许开发者添加自定义的电话和提供商处理器。