izwi-ai/izwi

Voice AI runtime. Local first transcription, speaker diarization, TTS, and voice cloning with an OpenAI compatible API.

解决的问题

Izwi 提供一个本地优先的语音 AI 环境,无需依赖云服务或 API 密钥。用户可以在自己的硬件上完全本地运行语音识别(ASR)、语音合成(TTS)和聊天模型,以确保数据隐私。

工作原理

它作为桌面应用、Web UI、CLI 和本地推理服务器运行。它负责管理 ASR(自动语音识别)、TTS(文本转语音)和 LLM 聊天模型的各种模型家族的下载与执行。系统还提供 OpenAI 兼容的 API 路由,允许其他应用程序使用其本地推理能力。

适用人群

适合希望在本地机器上执行音频工作流(如转录、语音克隆、实时语音对话)以保障隐私或实现离线访问的用户。

主要亮点

  • 全面的音频工具套件:支持实时语音对话、长篇录音项目、说话人分离和强制对齐。
  • 本地优先的隐私保护:推理数据保留在本地设备上,无需连接云端。
  • OpenAI 兼容性:提供 /v1 API 路由,用于聊天补全和音频任务。
  • 广泛的模型支持:集成 Qwen3、Whisper、Kokoro 和 Gemma 等多个模型家族。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目