SaynaAI/sayna

Sayna is a unified Voice Layer for AI Agents with a seemless integration to an existing agentic frameworks

解决的问题

Sayna 提供一个高性能的统一服务器,用于实时语音处理。它消除了为语音识别(STT)和文本转语音(TTS)集成多个独立 API 的需求,提供单一接口来管理各种提供商,同时处理双向音频流和降噪的复杂性。

工作原理

该服务器使用 Rust 构建,充当客户端与语音提供商之间的协调者。它使用 WebSocket 实现实时双向音频流,使用 REST API 处理简单任务。系统采用可插拔架构,支持在 Deepgram、ElevenLabs、Google Cloud 和 Microsoft Azure 等提供商之间切换。为提升音频质量和交互体验,集成了 Silero-VAD 实现语音活动检测和发言权切换,以及使用 DeepFilterNet 实现降噪。

适用人群

需要低延迟音频处理并能灵活切换不同 STT/TTS 提供商的语音应用、AI 代理或实时通信工具的开发者。

主要亮点

  • 统一 API:支持多个 STT 和 TTS 提供商的单一接口。
  • 实时流媒体:基于 WebSocket 的双向音频流。
  • LiveKit 集成:支持 WebRTC 音频流和基于房间的通信。
  • 高级音频处理:通过 DeepFilterNet 实现噪声过滤,使用 Silero-VAD 实现基于机器学习的发言权检测。
  • 灵活认证:支持将客户级认证委托给外部服务。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目