SaynaAI/sayna
Sayna is a unified Voice Layer for AI Agents with a seemless integration to an existing agentic frameworks
解決的問題
Sayna 提供一個高效率的統一伺服器,用於即時語音處理。它消除了為語音辨識(STT)與語音合成(TTS)整合多個獨立 API 的需求,提供單一介面來管理各種供應商,同時處理雙向音訊串流與降噪的複雜性。
運作方式
此伺服器以 Rust 編寫,作為客戶端與語音供應商之間的協調者。使用 WebSocket 實現即時雙向音訊串流,並以 REST API 處理簡單任務。系統採用可插入式架構,可於 Deepgram、ElevenLabs、Google Cloud 與 Microsoft Azure 等供應商之間切換。為提升音訊品質與互動體驗,整合 Silero-VAD 以實現語音活動與發言權偵測,並使用 DeepFilterNet 進行降噪。
適用對象
需要低延遲音訊處理並能靈活切換不同 STT/TTS 供應商的語音應用、AI 代理或即時通訊工具的開發者。
主要特色
- 統一 API:支援多個 STT 與 TTS 供應商的單一介面。
- 即時串流:基於 WebSocket 的雙向音訊流。
- LiveKit 集成:支援 WebRTC 音訊串流與基於房間的通訊。
- 進階音訊處理:透過 DeepFilterNet 實現降噪過濾,並使用 Silero-VAD 實現基於機器學習的發言權偵測。
- 彈性驗證:支援將客戶級驗證委由外部服務處理。
相關
- 專案
- 專案
- 專案
- 專案
- 專案