homelab-00/TranscriptionSuite

A fully local and private Speech-To-Text app, offering multiple model backends, diarization & calendar mode - Available for Windows, macOS & Linux

What it solves

TranscriptionSuite 提供一个完全本地、私密的语音转文字解决方案。它通过在用户自己的硬件上直接运行高性能的转录和说话人识别模型,消除将敏感音频数据发送到云端提供商的需求,支持 Windows、macOS 和 Linux。

How it works

项目由一个基于 Electron 的仪表盘(前端)和一个基于 Python 的服务器(后端)组成。它支持多种 Speech‑To‑Text(STT)后端,包括 Whisper(via faster‑whisper 和 whisper.cpp)、NVIDIA NeMo(Parakeet 和 Canary)以及 VibeVoice‑ASR。

根据硬件不同,使用不同的加速路径:

  • NVIDIA GPUs:通过 Docker 的 CUDA 加速。
  • Apple Silicon:原生 Metal/MLX GPU 栈。
  • AMD/Intel GPUs:Vulkan 支持(via whisper.cpp)。
  • CPU:所有平台的回退模式。

它还集成 PyAnnote 或 VibeVoice 进行说话人分段(识别谁在说话),并提供“Audio Notebook”模式,允许用户使用任何兼容 OpenAI 的 LLM 提供商与笔记聊天。

Who it’s for

它面向需要高隐私转录工作流的用户,如记者、研究人员,或任何想要本地“Audio Notebook”进行口述和会议记录且不依赖云服务的人。

Highlights

  • 100% 本地:音频永不离开机器;互联网仅用于初始模型下载。
  • 多后端支持:兼容 Whisper、NVIDIA NeMo 和 VibeVoice‑ASR。
  • 说话人分段:识别录音中的不同说话人。
  • 灵活输入:支持长时录音(麦克风或系统音频)、实时实时转录,以及导入已有音频文件。
  • Audio Notebook:基于日历的视图,具备全文搜索和 AI 助手查询笔记功能。
  • 跨平台:原生支持 Apple Silicon(Metal)、NVIDIA(CUDA)和 AMD/Intel(Vulkan)。