SaynaAI/sayna

Sayna is a unified Voice Layer for AI Agents with a seemless integration to an existing agentic frameworks

解決的問題

Sayna 提供一個高效率的統一伺服器,用於即時語音處理。它消除了為語音辨識(STT)與語音合成(TTS)整合多個獨立 API 的需求,提供單一介面來管理各種供應商,同時處理雙向音訊串流與降噪的複雜性。

運作方式

此伺服器以 Rust 編寫,作為客戶端與語音供應商之間的協調者。使用 WebSocket 實現即時雙向音訊串流,並以 REST API 處理簡單任務。系統採用可插入式架構,可於 Deepgram、ElevenLabs、Google Cloud 與 Microsoft Azure 等供應商之間切換。為提升音訊品質與互動體驗,整合 Silero-VAD 以實現語音活動與發言權偵測,並使用 DeepFilterNet 進行降噪。

適用對象

需要低延遲音訊處理並能靈活切換不同 STT/TTS 供應商的語音應用、AI 代理或即時通訊工具的開發者。

主要特色

  • 統一 API:支援多個 STT 與 TTS 供應商的單一介面。
  • 即時串流:基於 WebSocket 的雙向音訊流。
  • LiveKit 集成:支援 WebRTC 音訊串流與基於房間的通訊。
  • 進階音訊處理:透過 DeepFilterNet 實現降噪過濾,並使用 Silero-VAD 實現基於機器學習的發言權偵測。
  • 彈性驗證:支援將客戶級驗證委由外部服務處理。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案