izwi-ai/izwi

Voice AI runtime. Local first transcription, speaker diarization, TTS, and voice cloning with an OpenAI compatible API.

解決的問題

Izwi 提供一個本地優先的語音 AI 環境,無需依賴雲端服務或 API 金鑰。使用者可在自己的硬體上完全本地執行語音辨識(ASR)、語音合成(TTS)與聊天模型,以確保資料隱私。

運作方式

以桌面應用、Web UI、CLI 及本地推論伺服器運作。管理 ASR(自動語音辨識)、TTS(文字轉語音)與 LLM 聊天模型的各種模型家族之下載與執行。系統亦提供 OpenAI 相容的 API 路由,讓其他應用程式可使用其本地推論能力。

適用對象

適合希望在本地機器上執行音訊工作流程(如轉錄、語音克隆、即時語音對話)以保障隱私或實現離線存取的使用者。

主要特色

  • 全面的音訊工具套件:支援即時語音對話、長篇錄音專案、說話人分離與強制對齊。
  • 本地優先的隱私保護:推論資料留在本地裝置上,無需連接雲端。
  • OpenAI 相容性:提供 /v1 API 路由,用於聊天補全與音訊任務。
  • 廣泛的模型支援:整合 Qwen3、Whisper、Kokoro 與 Gemma 等多個模型家族。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案