jasoncheng7115/jt-live-whisper

100% 全地端 AI 語音工具集:即時轉錄、即時翻譯、錄音檔批次處理、講者辨識、會議摘要,所有 AI 模型皆在自有設備上運行,資料不經過任何雲端服務。

解决的问题

jt-live-whisper 提供一个完全本地化的 AI 工具包,用于实时语音转文字和翻译。它无需依赖云 API,确保敏感会议的数据隐私,并消除月度订阅费用。它解决了在实时音频事件(如 Zoom 会议、YouTube 视频或播客)中语言障碍的问题,以及手动总结录音会议的繁琐过程。

工作原理

该工具使用 macOS 上的 ScreenCaptureKit 或 Windows 上的 WASAPI Loopback 捕获系统音频,并通过本地 AI 模型的流水线进行处理:

  1. 语音识别(ASR): 使用 OpenAI 的 Whisper(通过 whisper.cppfaster-whispermlx-whisper),Moonshine 用于超低延迟的英文,或 Breeze-ASR-26 用于台湾闽南语。
  2. 翻译: 使用本地 LLM(通过 Ollama、LM Studio 等),Meta 的 NLLB 600M,或 Argos Translate 实现中文、英文和日文之间的离线翻译。
  3. 说话人分离: 使用 resemblyzerspectralcluster 通过声纹识别并区分不同说话人。
  4. 摘要生成: 使用本地 LLM 生成会议摘要并纠正语音识别错误。

它可以在单机模式(使用本地 CPU/GPU)下运行,也可以在混合模式下运行,即本地机器负责音频捕获,远程 GPU 服务器执行繁重的 AI 推理。

适用人群

  • 需要实时字幕的多语言在线会议(Zoom、Teams、Meet)参与者。
  • 希望在不上传数据到云端的情况下,私密地转录和总结录音文件的用户。
  • 学习语言或观看外语内容,需要即时翻译的人。
  • 拥有本地 GPU 硬件(NVIDIA 或 Apple Silicon)并希望利用自身计算资源进行 AI 任务的用户。

主要亮点

  • 100% 本地执行: 无需云 API 密钥或数据上传。
  • 系统级音频捕获: 适用于任何输出声音的软件,不限于特定应用程序。
  • 多语言支持: 对英语、中文、日语和台湾闽南语提供专门支持。
  • 全面工具集: 包含实时字幕、离线批量处理、说话人识别和 AI 驱动的会议摘要。
  • 灵活接口: 提供基于终端的交互式菜单、完整的 WebUI 和半透明浮动字幕叠加层。
  • 集成能力: 可将实时字幕转发至 Telegram、Slack 和 Discord 等平台。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目