jasoncheng7115/jt-live-whisper

100% 全地端 AI 語音工具集:即時轉錄、即時翻譯、錄音檔批次處理、講者辨識、會議摘要,所有 AI 模型皆在自有設備上運行,資料不經過任何雲端服務。

解決的問題

jt-live-whisper 提供一個完全本地化的 AI 工具包,用於即時語音轉文字與翻譯。它無需依賴雲端 API,確保敏感會議的資料隱私,並消除月費訂閱成本。它解決了在即時音訊事件(如 Zoom 會議、YouTube 影片或播客)中語言障礙的問題,以及手動總結錄音會議的繁瑣過程。

工作原理

該工具使用 macOS 上的 ScreenCaptureKit 或 Windows 上的 WASAPI Loopback 捕獲系統音訊,並透過本地 AI 模型的流程進行處理:

  1. 語音辨識(ASR): 使用 OpenAI 的 Whisper(透過 whisper.cppfaster-whispermlx-whisper),Moonshine 用於超低延遲的英文,或 Breeze-ASR-26 用於台灣閩南語。
  2. 翻譯: 使用本地 LLM(透過 Ollama、LM Studio 等),Meta 的 NLLB 600M,或 Argos Translate 實現中、英、日文之間的離線翻譯。
  3. 說話人分離: 使用 resemblyzerspectralcluster 透過聲紋識別並區分不同說話人。
  4. 摘要生成: 使用本地 LLM 生成會議摘要並修正語音辨識錯誤。

它可在單機模式(使用本地 CPU/GPU)下運行,也可在混合模式下運行,即本地機器負責音訊捕獲,遠端 GPU 伺服器執行繁重的 AI 推論。

適用對象

  • 需要即時字幕的多語言線上會議(Zoom、Teams、Meet)參與者。
  • 希望在不將資料上傳至雲端的情況下,私密地轉錄與總結錄音檔案的使用者。
  • 學習語言或觀看外語內容,需要即時翻譯的人。
  • 擁有本地 GPU 硬體(NVIDIA 或 Apple Silicon)並希望利用自身運算資源進行 AI 任務的使用者。

主要亮點

  • 100% 本地執行: 無需雲端 API 金鑰或資料上傳。
  • 系統級音訊捕獲: 適用於任何輸出聲音的軟體,不限於特定應用程式。
  • 多語言支援: 對英語、中文、日語和台灣閩南語提供專門支援。
  • 完整工具集: 包含即時字幕、離線批次處理、說話人識別與 AI 驅動的會議摘要。
  • 彈性介面: 提供終端機基礎的互動式選單、完整的 WebUI 與半透明浮動字幕疊加層。
  • 整合能力: 可將即時字幕轉送至 Telegram、Slack 和 Discord 等平台。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案