jasoncheng7115/jt-live-whisper

100% 全地端 AI 語音工具集:即時轉錄、即時翻譯、錄音檔批次處理、講者辨識、會議摘要,所有 AI 模型皆在自有設備上運行,資料不經過任何雲端服務。

何を解決するか

jt-live-whisper は、クラウドAPIを一切使用せずに、リアルタイムの音声認識と翻訳を実現する完全にローカルなAIツールキットを提供します。機密性の高い会議におけるデータのプライバシーを確保し、月額サブスクリプション料金を削減します。Zoom通話やYouTube動画、ポッドキャストなどのライブ音声イベントにおける言語の壁を克服し、録音された会議の手動要約作業の煩わしさを解消します。

動作方法

このツールは、macOSではScreenCaptureKit、WindowsではWASAPI Loopbackを使用してシステム音声をキャプチャし、ローカルAIモデルのパイプラインで処理します。

  1. 音声認識(ASR): OpenAIのWhisper(whisper.cppfaster-whispermlx-whisper経由)、Moonshine(超低遅延の英語用)、Breeze-ASR-26(台湾語用)を使用。
  2. 翻訳: Ollama、LM StudioなどによるローカルLLM、MetaのNLLB 600M、Argos Translateを使用して、中国語、英語、日本語間のオフライン翻訳を実現。
  3. 話者分離: resemblyzerspectralcluster を使用して、声紋に基づいて異なる話者を識別・分離。
  4. 要約: ローカルLLMを使用して会議の要約を生成し、音声認識の誤りを修正。

単一マシンモード(ローカルCPU/GPU使用)またはハイブリッドモード(ローカルマシンで音声キャプチャ、リモートGPUサーバーでAI推論処理)で動作可能。

対象ユーザー

  • マルチリンガルなオンライン会議(Zoom、Teams、Meet)に参加し、リアルタイム字幕が必要なプロフェッショナル。
  • クラウドにデータをアップロードせずに、録音されたオーディオファイルをプライベートに音声認識・要約したいユーザー。
  • 言語学習者や外国語コンテンツ視聴者で、即時翻訳が必要な人。
  • NVIDIAまたはApple Silicon搭載のローカルGPUハードウェアを持っているが、自前の計算リソースをAIタスクに活用したいユーザー。

特徴

  • 100% ローカル実行: クラウドAPIキーもデータアップロードも不要。
  • システムワイドな音声キャプチャ: 特定のアプリに限定せず、あらゆる音声出力ソフトウェアに対応。
  • 多言語対応: 英語、中国語、日本語、台湾語(台湾閩南語)の専用サポート。
  • 包括的なツールキット: リアルタイム字幕、オフラインバッチ処理、話者識別、AI駆動の会議要約をすべて内蔵。
  • 柔軟なインターフェース: ターミナルベースのインタラクティブメニュー、完全なWebUI、半透明の浮動字幕オーバーレイを提供。
  • 統合機能: リアルタイム字幕をTelegram、Slack、Discordなどのプラットフォームに転送可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト