bolna-ai/bolna

Conversational voice AI agents

解決的問題

Bolna 解決了構建生產級語音驅動對話助手時的複雜性。它處理將多個專業服務(如語音識別、大型語言模型和文字轉語音)編排成單一、連貫的對話流這一艱巨任務。

工作原理

該平台作為一個編排層,透過 websockets 連接不同的提供商。它通常遵循一個流水線:轉錄音訊輸入 (ASR)、透過 LLM 處理文本,並將回應合成回音訊 (TTS)。它支援透過 Twilio 或 Plivo 等提供商進行電話整合,以實現真實的電話通話互動。

適用對象

專為尋求構建語音優先 AI 應用程式的開發者設計,範圍涵蓋從簡單的純文本助手到複雜的電話整合語音代理。

亮點

  • 多提供商支援:整合 ASR (Deepgram, Azure)、LLMs (OpenAI, Llama, Mistral) 和 TTS (ElevenLabs, AWS Polly, Cartesia)。
  • 電話整合:支援透過 Twilio 和 Plivo 發起與管理通話。
  • 靈活的編排:可以使用程式化 Python 函式庫或透過託管 API 使用。
  • 端到端流水線:管理從音訊輸入到合成音訊輸出的完整生命週期。
  • 可擴展架構:允許開發者添加自定義的電話與提供商處理器。