jasoncheng7115/jt-live-whisper
100% 全地端 AI 語音工具集:即時轉錄、即時翻譯、錄音檔批次處理、講者辨識、會議摘要,所有 AI 模型皆在自有設備上運行,資料不經過任何雲端服務。
解決的問題
jt-live-whisper 提供一個完全本地化的 AI 工具包,用於即時語音轉文字與翻譯。它無需依賴雲端 API,確保敏感會議的資料隱私,並消除月費訂閱成本。它解決了在即時音訊事件(如 Zoom 會議、YouTube 影片或播客)中語言障礙的問題,以及手動總結錄音會議的繁瑣過程。
工作原理
該工具使用 macOS 上的 ScreenCaptureKit 或 Windows 上的 WASAPI Loopback 捕獲系統音訊,並透過本地 AI 模型的流程進行處理:
- 語音辨識(ASR): 使用 OpenAI 的 Whisper(透過
whisper.cpp、faster-whisper或mlx-whisper),Moonshine 用於超低延遲的英文,或 Breeze-ASR-26 用於台灣閩南語。 - 翻譯: 使用本地 LLM(透過 Ollama、LM Studio 等),Meta 的 NLLB 600M,或 Argos Translate 實現中、英、日文之間的離線翻譯。
- 說話人分離: 使用
resemblyzer和spectralcluster透過聲紋識別並區分不同說話人。 - 摘要生成: 使用本地 LLM 生成會議摘要並修正語音辨識錯誤。
它可在單機模式(使用本地 CPU/GPU)下運行,也可在混合模式下運行,即本地機器負責音訊捕獲,遠端 GPU 伺服器執行繁重的 AI 推論。
適用對象
- 需要即時字幕的多語言線上會議(Zoom、Teams、Meet)參與者。
- 希望在不將資料上傳至雲端的情況下,私密地轉錄與總結錄音檔案的使用者。
- 學習語言或觀看外語內容,需要即時翻譯的人。
- 擁有本地 GPU 硬體(NVIDIA 或 Apple Silicon)並希望利用自身運算資源進行 AI 任務的使用者。
主要亮點
- 100% 本地執行: 無需雲端 API 金鑰或資料上傳。
- 系統級音訊捕獲: 適用於任何輸出聲音的軟體,不限於特定應用程式。
- 多語言支援: 對英語、中文、日語和台灣閩南語提供專門支援。
- 完整工具集: 包含即時字幕、離線批次處理、說話人識別與 AI 驅動的會議摘要。
- 彈性介面: 提供終端機基礎的互動式選單、完整的 WebUI 與半透明浮動字幕疊加層。
- 整合能力: 可將即時字幕轉送至 Telegram、Slack 和 Discord 等平台。
相關
- 專案
- 專案
- 專案
- 專案
- 專案