izwi-ai/izwi

Voice AI runtime. Local first transcription, speaker diarization, TTS, and voice cloning with an OpenAI compatible API.

何を解決するか

Izwi はクラウドサービスや API キーの必要なく、ローカル優先の音声 AI 環境を提供します。ユーザーは自分のハードウェア上で音声認識(ASR)、音声合成(TTS)、チャットモデルを完全にローカルで実行し、データのプライバシーを確保できます。

動作方法

デスクトップアプリ、Web UI、CLI、ローカル推論サーバーとして動作します。ASR(音声認識)、TTS(音声合成)、LLM チャット用のさまざまなモデルファミリーのダウンロードと実行を管理します。また、OpenAI互換の API ルートを公開しており、他のアプリケーションがローカル推論機能を利用できます。

対象ユーザー

プライバシー保護やオフラインアクセスを求めるユーザー向けです。音声のトランスクリプション、ボイスクラーニング、リアルタイム音声会話などのオーディオワークフローを、自分のマシン上でローカルで実行したい方におすすめです。

特徴

  • 包括的なオーディオツールキット: リアルタイム音声会話、長時間のスタジオプロジェクト、話者分離、強制同期をサポート。
  • ローカル優先のプライバシー: 推論データはローカルマシン上に留まり、クラウド接続は不要です。
  • OpenAI互換性: チャット完了および音声タスク用の /v1 API ルートを提供。
  • 広範なモデル対応: Qwen3、Whisper、Kokoro、Gemma など、複数のモデルファミリーを統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト