bolna-ai/bolna

Conversational voice AI agents

解决的问题

Bolna 解决了构建生产级语音驱动对话助手时的复杂性。它处理将多个专业服务(如语音识别、大语言模型和文本转语音)编排成单一、连贯的对话流这一艰巨任务。

工作原理

该平台作为一个编排层,通过 websockets 连接不同的提供商。它通常遵循一个流水线:转录音频输入 (ASR)、通过 LLM 处理文本,并将响应合成回音频 (TTS)。它支持通过 Twilio 或 Plivo 等提供商进行电话集成,以实现真实的电话通话交互。

适用对象

专为寻求构建语音优先 AI 应用的开发者设计,范围涵盖从简单的纯文本助手到复杂的电话集成语音智能体。

亮点

  • 多提供商支持:集成 ASR (Deepgram, Azure)、LLMs (OpenAI, Llama, Mistral) 和 TTS (ElevenLabs, AWS Polly, Cartesia)。
  • 电话集成:支持通过 Twilio 和 Plivo 发起和管理通话。
  • 灵活的编排:可以使用编程 Python 库或通过托管 API 使用。
  • 端到端流水线:管理从音频输入到合成音频输出的完整生命周期。
  • 可扩展架构:允许开发者添加自定义的电话和提供商处理器。