kizuna-ai-lab/sokuji

Real-time two-way speech translation for bilingual meetings — auto-detects the spoken language and translates both directions, cloud or fully offline on-device. Desktop (Windows · macOS · Linux) + browser extension (Chrome · Edge) for Zoom, Meet, Teams & any app.

Sokuji – リアルタイム双方向音声翻訳

概要 – Sokujiは、バイリンガル会議の参加者が自分の母語で話し、もう一方の言語での即時翻訳を聴く(または読む)ことを可能にするクロスプラットフォームのデスクトップアプリおよびブラウザ拡張機能です。WebAssembly/WebGPUにコンパイルされたオンデバイスモデルを使用して完全にオフラインで動作させることも、OpenAI、Google Gemini、Palabra.ai、Sonioxなどのクラウドプロバイダーにオーディオを転送することもできます。

重要性 – リアルタイム音声翻訳は通常、クラウドAPIとインターネット接続を必要とし、レイテンシ、コスト、プライバシーに関する懸念を生じさせます。Sokujiのローカル推論モードはこれらの障壁を排除します:APIキー不要、GPU不要、データがデバイス外に出ることなく、それでもASR、翻訳、TTSモデルの豊富なコレクションを通じて数十の言語をサポートします。


主な機能

カテゴリ 詳細
オーディオパイプライン 音声認識 → 機械翻訳 → 音声合成、すべてを単一のストリーム内で処理。双方向翻訳をサポート(どの話者がどの言語を使用しているかを自動検出)。
ローカルモデル 44のASRモデル(Whisper、Cohere Transcribe、Voxtralを含む)、75の翻訳モデル(Opus-MT、Qwen、TranslateGemma)、137のTTSモデル(Piper、Coqui、VITSなど)。
クラウドプロバイダー OpenAI、Google Gemini、Palabra.ai、Kizuna AI、Doubao AST 2.0、Soniox、Zoom AI Services、汎用のOpenAI互換エンドポイント。
言語 音声認識は99言語以上、翻訳は55言語以上、TTSは53言語。
プラットフォーム Windows、macOS(Intel & Apple Silicon)、Linux(debパッケージ)、Chrome/Edge/Brave拡張機能。
プライバシー ローカル推論モードではすべてがオンデバイスで実行されます。クラウドモードでは中間サーバーを介さずプロバイダーに直接接続します。
オーディオ機能 仮想マイク出力、リアルタイムノイズサプレッション、エコーキャンセリング、ライブ字幕、システムオーディオキャプチャ。

動作原理(高レベルフロー)

  1. キャプチャ – マイク(あなたの声)および/またはシステムオーディオ(他の参加者)。
  2. モード選択クラウド(オーディオをプロバイダーに送信)またはローカル(WASM + WebGPUを使用してブラウザ/Electron内でASR/翻訳/TTSを実行)。
  3. 処理 – ASRがテキストを生成し、翻訳モデルが変換し、TTSモデルがターゲット言語の音声を合成します。
  4. 出力 – 合成されたオーディオは仮想マイクに送信され、Zoom、Teams、Meet、Discordなどが翻訳された声を再生します。字幕は表示または画面共有できます。

はじめに

ターゲット インストール手順
デスクトップアプリ Releasesページから適切なインストーラーをダウンロード(Windows .exe、macOS .pkg、Linux .deb)。インストーラーを実行してSokujiを起動します。
ブラウザ拡張機能 Chrome Web StoreまたはMicrosoft Edge Add-onsから追加するか、開発者モードでzip形式の拡張機能をロードします(READMEを参照)。
ソースからのビルド ```bash
git clone https://github.com/kizuna-ai-lab/sokuji.git
cd sokuji && npm install
npm run electron:dev # dev mode
npm run electron:build # production build

---
### 典型的な使用例
1. Sokujiを開き、*言語A*(例:日本語)と*言語B*(例:英語)を設定します。  
2. Zoom、Teams、Google Meet、Discordなどで会議を開始します。  
3. 母語で話します。Sokujiは言語を検出し、翻訳し、翻訳された声を会議にストリーミングします。  
4. 他の参加者はあなたが彼らの言語で話しているかのように聞こえ、あなたは彼らの発言があなたの言語に翻訳されて聞こえます – すべてリアルタイムで。

---
### ライセンスとコミュニティ
- **ライセンス:** AGPL-3.0(配布時にはソースコードをオープンに保つ必要があります)。  
- **貢献:** ガイドラインが提供されています。プロジェクトはプルリクエストとバグレポートを歓迎しています。  
- **サポート:** GitHub上のIssues、アイデアのためのDiscussions、およびWindowsビルドに無料のコード署名を提供するスポンサー(SignPath)。

---
### 要約
Sokujiは、ライブバイリンガル会議のための、すぐに使用可能でプライバシー優先のソリューションです。オンデバイスの音声モデルの大きなスイートを使用して完全にオフラインで動作させることも、主要なクラウドAIサービスに接続することもできます。デスクトップアプリまたはブラウザ拡張機能をインストールし、2つの言語を選択し、Zoom、Teams、Meet、Discordおよび多くの他のプラットフォームでのリアルタイム翻訳、字幕、仮想マイクルーティングをツールに任せます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト