SaynaAI/sayna

Sayna is a unified Voice Layer for AI Agents with a seemless integration to an existing agentic frameworks

해결하는 문제

Sayna는 실시간 음성 처리를 위한 고성능 통합 서버를 제공합니다. 음성 인식(STT)과 음성 합성(TTS)을 위한 여러 개별 API를 통합할 필요 없이, 다양한 공급자를 단일 인터페이스로 관리할 수 있으며, 양방향 오디오 스트리밍과 노이즈 제거의 복잡성을 처리합니다.

작동 방식

Rust로 구현된 이 서버는 클라이언트와 음성 공급자 간의 조율자 역할을 합니다. 실시간 양방향 오디오 스트리밍에는 WebSocket을 사용하고, 간단한 작업에는 REST API를 사용합니다. 플러그인 아키텍처를 통해 Deepgram, ElevenLabs, Google Cloud, Microsoft Azure 등의 공급자 간에 쉽게 전환할 수 있습니다. 오디오 품질과 상호작용을 향상시키기 위해 Silero-VAD를 통한 음성 활동 및 전환 감지, DeepFilterNet을 통한 노이즈 제거를 통합합니다.

대상 사용자

저지연 오디오 처리가 필요하고, 다양한 STT/TTS 공급자 간 전환 기능이 필요한 음성 기반 애플리케이션, AI 에이전트, 실시간 커뮤니케이션 도구를 개발하는 개발자들입니다.

주요 특징

  • 통합 API: 여러 STT 및 TTS 공급자를 위한 단일 인터페이스.
  • 실시간 스트리밍: WebSocket 기반 양방향 오디오 흐름.
  • LiveKit 통합: WebRTC 오디오 스트리밍 및 룸 기반 통신 지원.
  • 고급 오디오 처리: DeepFilterNet을 통한 노이즈 필터링 및 Silero-VAD를 통한 ML 기반 전환 감지.
  • 유연한 인증: 외부 서비스에 위임된 고객 기반 인증 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트