SaynaAI/sayna
Sayna is a unified Voice Layer for AI Agents with a seemless integration to an existing agentic frameworks
解决的问题
Sayna 提供一个高性能的统一服务器,用于实时语音处理。它消除了为语音识别(STT)和文本转语音(TTS)集成多个独立 API 的需求,提供单一接口来管理各种提供商,同时处理双向音频流和降噪的复杂性。
工作原理
该服务器使用 Rust 构建,充当客户端与语音提供商之间的协调者。它使用 WebSocket 实现实时双向音频流,使用 REST API 处理简单任务。系统采用可插拔架构,支持在 Deepgram、ElevenLabs、Google Cloud 和 Microsoft Azure 等提供商之间切换。为提升音频质量和交互体验,集成了 Silero-VAD 实现语音活动检测和发言权切换,以及使用 DeepFilterNet 实现降噪。
适用人群
需要低延迟音频处理并能灵活切换不同 STT/TTS 提供商的语音应用、AI 代理或实时通信工具的开发者。
主要亮点
- 统一 API:支持多个 STT 和 TTS 提供商的单一接口。
- 实时流媒体:基于 WebSocket 的双向音频流。
- LiveKit 集成:支持 WebRTC 音频流和基于房间的通信。
- 高级音频处理:通过 DeepFilterNet 实现噪声过滤,使用 Silero-VAD 实现基于机器学习的发言权检测。
- 灵活认证:支持将客户级认证委托给外部服务。
相关
- 项目
- 项目
- 项目
- 项目
- 项目