homelab-00/TranscriptionSuite
A fully local and private Speech-To-Text app, offering multiple model backends, diarization & calendar mode - Available for Windows, macOS & Linux
解决的问题
TranscriptionSuite 是一款免费开源的应用程序,允许用户在自己的计算机上本地将语音转换为文本。无需将音频数据发送到云服务,确保隐私和安全,同时提供带有说话人标签的准确转录。
工作原理
该项目由两个主要组件组成:使用 Electron 构建的桌面仪表板和 Python 后端的转录服务器。服务器可通过 Metal/MLX 在 Apple Silicon 上原生运行,或在 Windows 和 Linux 上通过 Docker 容器运行。支持多种语音转文本后端,包括 Whisper、NVIDIA NeMo、VibeVoice-ASR、SenseVoice 和 whisper.cpp,并支持 NVIDIA CUDA、Apple Metal 和 AMD/Intel Vulkan 的硬件加速。
适用人群
适用于任何需要私有本地转录的用户,例如记录讲座的学生、撰写文档的职场人士,或希望使用集成 AI 助手管理可搜索音频笔记的用户。
主要亮点
- 100% 本地化 & 隐私保护:音频和转录内容从不离开本地设备。
- 说话人分离:使用 PyAnnote、CAM++、Sortformer 或内置模型功能自动标注“谁说了什么”。
- 多后端支持:兼容多种模型(Whisper、NeMo、SenseVoice 等)和硬件(NVIDIA、Apple Silicon、AMD/Intel)。
- 实时模式:支持连续语音输入的实时逐句转录。
- 音频笔记本:带全文搜索功能的日历视图存储系统,以及兼容 OpenAI 兼容提供者的 AI 助手。
- 广泛兼容性:通过 Whisper 支持 90 多种语言,通过 Canary v2 实现欧洲语言的双向翻译。
相关
- 项目
- 项目
- 项目
- 项目
- 项目