jasoncheng7115/jt-live-whisper
100% 全地端 AI 語音工具集:即時轉錄、即時翻譯、錄音檔批次處理、講者辨識、會議摘要,所有 AI 模型皆在自有設備上運行,資料不經過任何雲端服務。
解决的问题
jt-live-whisper 提供一个完全本地化的 AI 工具包,用于实时语音转文字和翻译。它无需依赖云 API,确保敏感会议的数据隐私,并消除月度订阅费用。它解决了在实时音频事件(如 Zoom 会议、YouTube 视频或播客)中语言障碍的问题,以及手动总结录音会议的繁琐过程。
工作原理
该工具使用 macOS 上的 ScreenCaptureKit 或 Windows 上的 WASAPI Loopback 捕获系统音频,并通过本地 AI 模型的流水线进行处理:
- 语音识别(ASR): 使用 OpenAI 的 Whisper(通过
whisper.cpp、faster-whisper或mlx-whisper),Moonshine 用于超低延迟的英文,或 Breeze-ASR-26 用于台湾闽南语。 - 翻译: 使用本地 LLM(通过 Ollama、LM Studio 等),Meta 的 NLLB 600M,或 Argos Translate 实现中文、英文和日文之间的离线翻译。
- 说话人分离: 使用
resemblyzer和spectralcluster通过声纹识别并区分不同说话人。 - 摘要生成: 使用本地 LLM 生成会议摘要并纠正语音识别错误。
它可以在单机模式(使用本地 CPU/GPU)下运行,也可以在混合模式下运行,即本地机器负责音频捕获,远程 GPU 服务器执行繁重的 AI 推理。
适用人群
- 需要实时字幕的多语言在线会议(Zoom、Teams、Meet)参与者。
- 希望在不上传数据到云端的情况下,私密地转录和总结录音文件的用户。
- 学习语言或观看外语内容,需要即时翻译的人。
- 拥有本地 GPU 硬件(NVIDIA 或 Apple Silicon)并希望利用自身计算资源进行 AI 任务的用户。
主要亮点
- 100% 本地执行: 无需云 API 密钥或数据上传。
- 系统级音频捕获: 适用于任何输出声音的软件,不限于特定应用程序。
- 多语言支持: 对英语、中文、日语和台湾闽南语提供专门支持。
- 全面工具集: 包含实时字幕、离线批量处理、说话人识别和 AI 驱动的会议摘要。
- 灵活接口: 提供基于终端的交互式菜单、完整的 WebUI 和半透明浮动字幕叠加层。
- 集成能力: 可将实时字幕转发至 Telegram、Slack 和 Discord 等平台。
相关
- 项目
- 项目
- 项目
- 项目
- 项目