SaynaAI/sayna
Sayna is a unified Voice Layer for AI Agents with a seemless integration to an existing agentic frameworks
何を解決するか
Saynaは、リアルタイム音声処理用の高性能で統合されたサーバーを提供します。音声認識(STT)と音声合成(TTS)のための複数の別々のAPIを統合する必要がなく、さまざまなプロバイダーを1つのインターフェースで管理でき、双方向音声ストリーミングやノイズ低減の複雑さを処理します。
動作方法
Rustで構築されたこのサーバーは、クライアントと音声プロバイダーの調整役として機能します。リアルタイムで双方向の音声ストリーミングにはWebSocketを使用し、簡単なタスクにはREST APIを使用します。プラグインアーキテクチャにより、Deepgram、ElevenLabs、Google Cloud、Microsoft Azureなどのプロバイダー間で切り替えることが可能になります。音声品質と相互作用を向上させるために、Silero-VADによる音声活動検出と話者切り替え検出、DeepFilterNetによるノイズ低減を統合しています。
対象ユーザー
低遅延音声処理を必要とする音声対応アプリケーション、AIエージェント、リアルタイム通信ツールを開発する開発者。
特徴
- 統合API: 複数のSTTおよびTTSプロバイダー用の1つのインターフェース。
- リアルタイムストリーミング: WebSocketベースの双方向音声フロー。
- LiveKit統合: WebRTC音声ストリーミングおよびルームベース通信をサポート。
- 高度な音声処理: DeepFilterNetによるノイズフィルタリングとSilero-VADによるMLベースの話者切り替え検出を統合。
- 柔軟な認証: クライアントベースの認証を外部サービスに委任するサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト