bolna-ai/bolna
Conversational voice AI agents
解決する課題
Bolnaは、本番環境向けの音声駆動型対話アシスタントを構築する際の複雑さを解決します。音声認識、大規模言語モデル、テキスト読み上げといった複数の特化型サービスを、単一の整合性のある会話フローへとオーケストレーションするという困難なタスクを処理します。
仕組み
このプラットフォームは、websocketsを介して異なるプロバイダーを接続するオーケストレーション層として機能します。通常、音声入力の文字起こし (ASR)、LLMによるテキスト処理、そして応答を音声に合成する (TTS) というパイプラインに従います。また、TwilioやPlivoなどのプロバイダーを介した電話統合をサポートしており、現実世界の電話通話インタラクションを可能にします。
対象者
シンプルなテキストのみのアシスタントから、複雑な電話統合型音声エージェントまで、音声ファーストのAIアプリケーションの構築を目指す開発者向けに設計されています。
ハイライト
- マルチプロバイダー対応: ASR (Deepgram, Azure), LLMs (OpenAI, Llama, Mistral), および TTS (ElevenLabs, AWS Polly, Cartesia) と統合。
- 電話統合: Twilio および Plivo を介した通話の開始と管理をサポート。
- 柔軟なオーケストレーション: プログラマブルな Python ライブラリとして、またはホストされた API を介して使用可能。
- エンドツーエンドのパイプライン: 音声入力から合成音声出力までのフルライフサイクルを管理。
- 拡張可能なアーキテクチャ: 開発者がカスタムの電話およびプロバイダーハンドラーを追加できるようになっています。