peteonrails/voxtype
Voice-to-text with push-to-talk for Wayland compositors
해결하는 문제
Voxtype은 Linux용 로컬 음성-텍스트 도구로, 사용자가 어떤 애플리케이션의 커서 위치에 직접 음성으로 텍스트를 입력할 수 있게 해줍니다. 클라우드 기반의 음성 인식 서비스에 의존하지 않으며, 개인 정보 보호와 낮은 지연 시간을 제공하는 시스템 전체 음성 입력 대안을 제공합니다.
작동 방식
이 도구는 설정된 핫키(푸시 투 톡 또는 토글)를 대기하는 백그라운드 데몬으로 실행됩니다. 핫키가 눌리면 오디오를 녹음하고, 해제되면 여러 로컬 AI 엔진 중 하나를 사용해 오디오를 음성 인식합니다. 그 후 활성 창에 텍스트를 시뮬레이션 입력합니다. Linux 데스크톱 환경(Wayland 및 X11)과 깊이 통합되어 있으며, MPRIS를 통해 미디어 플레이어를 자동으로 일시 정지할 수 있습니다.
대상 사용자
클라우드 구독이나 텔레메트리에 의존하지 않고, 빠르고 개인 정보 보호가 되며 고도로 사용자 정의 가능한 음성-텍스트 경험을 원하는 Linux 사용자.
주요 기능
- 다중 AI 엔진: Whisper, Parakeet, Moonshine, SenseVoice, Paraformer, Dolphin, Omnilingual을 지원하며, 1600개 이상의 언어를 커버합니다.
- 고성능: CPU 및 GPU(Vulkan, CUDA, Metal, ROCm) 가속을 최적화하여 최신 CPU에서 최대 11배 실시간 속도를 달성합니다.
- 로컬 우선: 클라우드, 구독, 텔레메트리 없음; 오디오는 기계 내부에 머무릅니다.
- 고급 텍스트 처리: 내장된 단어 대체, 발화된 구두점 변환, 외부 LLM을 통해 문법 수정을 위한 파이프 처리 기능을 포함합니다.
- 회의 모드: 스피커 식별이 가능한 지속적인 음성 인식을 제공하며, Markdown, JSON, SRT 등의 형식으로 내보낼 수 있습니다.
- 네이티브 Linux 통합: Hyprland, Sway, GNOME, KDE 등 다양한 컴포지터를 지원하며, 시각 피드백용 부유형 파형 OSD를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트