homelab-00/TranscriptionSuite
A fully local and private Speech-To-Text app, offering multiple model backends, diarization & calendar mode - Available for Windows, macOS & Linux
What it solves
TranscriptionSuite는 완전 로컬, 프라이빗한 음성‑텍스트 변환 솔루션을 제공합니다. 고성능 전사 및 화자 식별 모델을 사용자의 하드웨어에서 직접 실행함으로써 민감한 오디오 데이터를 클라우드 제공업체에 전송할 필요를 없애며, Windows, macOS, Linux를 지원합니다.
How it works
이 프로젝트는 Electron 기반 대시보드(프론트엔드)와 Python 기반 서버(백엔드)로 구성됩니다. Whisper( faster‑whisper 및 whisper.cpp 사용), NVIDIA NeMo(Parakeet 및 Canary), VibeVoice‑ASR 등 여러 Speech‑To‑Text(STT) 백엔드를 지원합니다.
하드웨어에 따라 다른 가속 경로를 사용합니다:
- NVIDIA GPUs: Docker를 통한 CUDA 가속.
- Apple Silicon: 네이티브 Metal/MLX GPU 스택.
- AMD/Intel GPUs: Vulkan 지원(whisper.cpp 사용).
- CPU: 모든 플랫폼에 대한 폴백 모드.
또한 PyAnnote 또는 VibeVoice를 통합하여 화자 다이어리제이션(누가 말하고 있는지 식별)을 제공하고, "Audio Notebook" 모드를 통해 OpenAI 호환 LLM 제공자를 사용해 노트와 대화할 수 있습니다.
Who it’s for
높은 프라이버시가 요구되는 전사 워크플로우가 필요한 사용자, 예를 들어 기자, 연구원, 혹은 클라우드 서비스에 의존하지 않고 로컬 "Audio Notebook"을 사용해 받아쓰기 및 회의 메모를 작성하고자 하는 모든 사람을 위해 설계되었습니다.
Highlights
- 100% 로컬: 오디오는 절대 머신을 떠나지 않으며, 인터넷은 초기 모델 다운로드 시에만 사용됩니다.
- 멀티 백엔드 지원: Whisper, NVIDIA NeMo, VibeVoice‑ASR와 호환.
- 화자 다이어리제이션: 녹음에서 서로 다른 화자를 식별.
- 유연한 입력: 긴 녹음(마이크 또는 시스템 오디오), 실시간 실시간 전사, 기존 오디오 파일 가져오기 지원.
- Audio Notebook: 캘린더 기반 뷰, 전체 텍스트 검색 및 AI 어시스턴트를 통한 노트 질의 기능 제공.
- 크로스‑플랫폼: Apple Silicon(Metal), NVIDIA(CUDA), AMD/Intel(Vulkan)을 네이티브 지원.