izwi-ai/izwi
Voice AI runtime. Local first transcription, speaker diarization, TTS, and voice cloning with an OpenAI compatible API.
解决的问题
Izwi 提供一个本地优先的语音 AI 环境,无需依赖云服务或 API 密钥。用户可以在自己的硬件上完全本地运行语音识别(ASR)、语音合成(TTS)和聊天模型,以确保数据隐私。
工作原理
它作为桌面应用、Web UI、CLI 和本地推理服务器运行。它负责管理 ASR(自动语音识别)、TTS(文本转语音)和 LLM 聊天模型的各种模型家族的下载与执行。系统还提供 OpenAI 兼容的 API 路由,允许其他应用程序使用其本地推理能力。
适用人群
适合希望在本地机器上执行音频工作流(如转录、语音克隆、实时语音对话)以保障隐私或实现离线访问的用户。
主要亮点
- 全面的音频工具套件:支持实时语音对话、长篇录音项目、说话人分离和强制对齐。
- 本地优先的隐私保护:推理数据保留在本地设备上,无需连接云端。
- OpenAI 兼容性:提供
/v1API 路由,用于聊天补全和音频任务。 - 广泛的模型支持:集成 Qwen3、Whisper、Kokoro 和 Gemma 等多个模型家族。
相关
- 项目
- 项目
- 项目
- 项目
- 项目