bolna-ai/bolna

Conversational voice AI agents

해결하는 문제

Bolna는 프로덕션 수준의 음성 기반 대화형 어시스턴트를 구축할 때 발생하는 복잡성을 해결합니다. 음성 인식, 대규모 언어 모델, 텍스트 음성 변환과 같은 여러 전문 서비스를 단일하고 일관된 대화 흐름으로 오케스트레이션하는 어려운 작업을 처리합니다.

작동 방식

이 플랫폼은 websockets를 통해 다양한 제공업체를 연결하는 오케스트레이션 레이어 역할을 합니다. 일반적으로 오디오 입력 전사(ASR), LLM을 통한 텍스트 처리, 응답을 오디오로 합성(TTS)하는 파이프라인을 따릅니다. 또한 Twilio 또는 Plivo와 같은 제공업체를 통한 전화 통합을 지원하여 실제 전화 통화 상호작용을 가능하게 합니다.

대상 사용자

단순한 텍스트 전용 어시스턴트부터 복잡한 전화 통합형 음성 에이전트에 이르기까지, 음성 우선 AI 애플리케이션을 구축하려는 개발자를 위해 설계되었습니다.

주요 특징

  • 멀티 제공업체 지원: ASR (Deepgram, Azure), LLMs (OpenAI, Llama, Mistral) 및 TTS (ElevenLabs, AWS Polly, Cartesia)와 통합.
  • 전화 통합: Twilio 및 Plivo를 통한 통화 시작 및 관리 지원.
  • 유연한 오케스트레이션: 프로그래밍 가능한 Python 라이브러리 또는 호스팅된 API를 통해 사용 가능.
  • 엔드 투 엔드 파이프라인: 오디오 입력부터 합성된 오디오 출력까지 전체 라이프사이클을 관리.
  • 확장 가능한 아키텍처: 개발자가 사용자 정의 전화 및 제공업체 핸들러를 추가할 수 있도록 허용.