homelab-00/TranscriptionSuite
A fully local and private Speech-To-Text app, offering multiple model backends, diarization & calendar mode - Available for Windows, macOS & Linux
해결하는 문제
TranscriptionSuite는 사용자가 자신의 컴퓨터에서 음성을 텍스트로 변환할 수 있는 무료로 오픈소스인 애플리케이션입니다. 오디오 데이터를 클라우드 서비스에 전송할 필요 없이, 개인 정보 보호와 보안을 유지하면서도 말하는 사람을 구분한 정확한 번역본을 제공합니다.
작동 방식
이 프로젝트는 두 가지 주요 구성 요소로 이루어져 있습니다: Electron으로 제작된 데스크톱 대시보드와 Python 백엔드의 전사 서버입니다. 서버는 Apple Silicon에서 Metal/MLX를 통해 네이티브로 실행되거나, Windows 및 Linux에서 Docker 컨테이너 내에서 실행할 수 있습니다. Whisper, NVIDIA NeMo, VibeVoice-ASR, SenseVoice, whisper.cpp 등 다양한 음성 인식 백엔드를 지원하며, NVIDIA CUDA, Apple Metal, AMD/Intel Vulkan을 활용한 하드웨어 가속도 지원합니다.
대상 사용자
강의 녹음이 필요한 학생, 문서를 음성으로 작성하는 전문가, 또는 검색 가능한 노트북과 통합된 AI 어시스턴트를 통해 오디오 노트를 관리하고 싶은 사용자에게 적합합니다.
주요 기능
- 100% 로컬 & 개인 정보 보호: 오디오와 번역본은 기기에서 절대 나가지 않습니다.
- 화자 분리: PyAnnote, CAM++, Sortformer 또는 내장 모델 기능을 사용해 '누가 무엇을 말했는지' 자동 라벨링.
- 다중 백엔드 지원: Whisper, NeMo, SenseVoice 등 다양한 모델과 NVIDIA, Apple Silicon, AMD/Intel 등 다양한 하드웨어와 호환.
- 라이브 모드: 지속적인 음성 입력에 적합한 실시간 문장 단위 번역.
- 오디오 노트북: 전체 텍스트 검색이 가능한 캘린더 뷰 저장 시스템과 OpenAI 호환 제공자와 호환되는 AI 어시스턴트 포함.
- 광범위한 호환성: Whisper를 통해 90개 이상의 언어를 지원하며, Canary v2를 통해 유럽 언어에 대한 양방향 번역을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트