ideaplexa/voicetypr
Voicetypr - AI powered offline voice to text dictation tool for busy founders, vibe coders, AI power users on macos, windows. Alternative to wispr flow and superwhisper.
Voicetypr이란 무엇인가요?
Voicetypr는 macOS 및 Windows를 위한 오프라인 우선 데스크톱 받아쓰기 도구입니다. 컴퓨터 어디에서나 음성으로 입력할 수 있으며, 로컬 또는 선택적 클라우드 음성 인식 모델을 사용하여 오디오를 전사하고 결과 텍스트를 커서 위치에 바로 삽입합니다.
핵심 아이디어 (README에서)
| 아이디어 | 의미 |
|---|---|
| 시스템 전체 받아쓰기 | 전역 단축키로 녹음을 시작/중지할 수 있어 모든 앱(이메일, 코드 에디터, 브라우저 등)에서 받아쓰기가 가능합니다. |
| 기본 로컬 전사 | OpenAI-Whisper(macOS 및 Windows)와 Apple Silicon에 최적화된 Parakeet 모델을 사용합니다. 클라우드 제공업체를 선택하지 않는 한 인터넷 트래픽이 발생하지 않습니다. |
| 선택적 클라우드 제공업체 | 다른 서비스를 선호하는 경우 Soniox, OpenAI, Groq, Deepgram 또는 Cohere를 지정할 수 있습니다. |
| AI 포맷팅 | 전사 후 원본 텍스트를 LLM(OpenAI, Anthropic, Gemini 또는 OpenAI 호환 엔드포인트)을 통해 정리할 수 있습니다. |
| CLI 및 에이전트 통합 | voicetypr 명령줄 도구를 통해 스크립트나 자율 에이전트가 동일한 전사 파이프라인에 액세스하여 일반 텍스트나 구조화된 JSON을 받을 수 있습니다. |
| 네트워크 공유 | 하나의 Voicetypr 인스턴스가 LAN상의 개인 전사 서버 역할을 하여 다른 설치 환경에서 작업을 오프로드할 수 있습니다. |
| 로컬 모델 평생 라이선스 | 체험 기간 후 일회성 라이선스를 구매하면 로컬 실행 모델에 대한 분당 비용이 발생하지 않습니다. |
주요 기능
- 전역 단축키, 푸시 투 토크, 녹음 토글, 커서 자동 삽입
- Whisper(macOS/Windows) + Parakeet(Apple Silicon)을 통한 기기 내 전사
- 클라우드 STT 옵션 (Soniox, OpenAI, Groq, Deepgram, Cohere)
- OpenAI/Anthropic/Gemini 또는 사용자 지정 엔드포인트를 통한 LLM 기반 텍스트 다듬기
- 오디오/비디오 파일 전사; 클라우드 제공업체를 통한 화자 분리(diarization) 가능
- 검색, 메타데이터, 원본 vs 포맷팅 비교, 복사 또는 재전사 기능을 포함한 기록 보기
- LAN 기반 개인 전사 서버 (네트워크 공유)
- 에이전트 지원 CLI (
voicetypr transcribe … --json등) - 안정/베타 업데이트 채널; Microsoft Store 버전은 스토어 업데이트 준수
- 오디오 캡처, 단축키, 커서 삽입을 처리하는 Rust 기반의 가벼운 React UI
사용 방법
- 설치 – macOS 14+ DMG 또는 Windows 설치 프로그램 / Microsoft Store.
- 권한 부여 – 마이크 권한 및 (macOS) 커서 삽입을 위한 접근성 권한.
- 모델 다운로드 – 앱이 Whisper/Parakeet 파일을 한 번 가져와 로컬에 저장합니다.
- 단축키 설정 – 설정 → 일반에서 전역 단축키를 선택합니다.
- 받아쓰기 – 텍스트 필드에 커서를 두고 단축키를 누른 뒤 말하고 멈춥니다.
- 결과 – Voicetypr이 커서 위치에 전사 내용을 입력하고 기록에 저장합니다.
명령줄 인터페이스 (CLI)
CLI는 스크립트나 AI 에이전트를 위해 GUI 기능을 미러링합니다:
voicetypr status --json # 상태 정보
voicetypr models --json # 사용 가능한 로컬/클라우드 모델 목록
voicetypr transcribe --file note.wav --json # 파일 → 텍스트/JSON
voicetypr record --until-silence --json # 실시간 마이크 캡처
기본 출력은 사람이 읽기 쉬운 형식이며, --json은 자동화에 적합한 구조화된 객체를 반환합니다. 원격 서버나 클라우드 제공업체를 명시적으로 요청하지 않는 한 오디오는 기기를 떠나지 않습니다.
개인정보 보호 및 데이터 흐름
| 모드 | 컴퓨터를 떠나는 데이터 |
|---|---|
| 로컬 전사 | 없음 – 오디오와 텍스트는 기기에 유지됩니다. |
| 클라우드 전사 | 녹음된 오디오가 선택한 STT 제공업체로 전송됩니다. |
| AI 포맷팅 | 원본 전사 내용이 구성된 LLM 서비스로 전송됩니다. |
| 네트워크 공유 | 오디오가 구성한 Voicetypr 서버(LAN 또는 기타 네트워크)로 전송됩니다. |
| 진단 및 분석은 설정에서 토글할 수 있으며, 프로젝트의 개인정보 보호 정책에 보관 기간이 자세히 설명되어 있습니다. |
기술 스택
- 데스크톱 셸: Tauri v2 (Rust + webview) - 네이티브 윈도우, 자동 업데이트, 권한 관리.
- 프론트엔드: React 19, TypeScript, Tailwind CSS, shadcn/ui, Zustand 상태 관리.
- 백엔드: Rust - 오디오 캡처, 리샘플링, 단축키, 전사 오케스트레이션, 기록, 커서 삽입.
- 로컬 엔진: Whisper (CPU) - 양 OS 지원; Parakeet (Apple Silicon); Vulkan 가속 Whisper (Windows 옵션).
- 네트워크 공유: 동일한 Rust 백엔드 위에 구축된 인증된 클라이언트/서버.
코드 가져오기 및 직접 빌드
git clone https://github.com/ideaplexa/voicetypr.git
cd voicetypr
pnpm install # Node + React 의존성
pnpm tauri:dev # 개발 모드 실행 (Rust 툴체인, Tauri 필수 요소 필요)
필수 요소: Node + pnpm, Rust stable, Tauri v2 플랫폼 도구, Xcode CLI (macOS) 또는 Visual Studio Build Tools (Windows). Lint, 타입 체크, 테스트 스크립트 (pnpm lint, pnpm test 등)가 제공됩니다.
라이선스 및 커뮤니티
- 라이선스: GNU Affero General Public License v3 (AGPL-3.0).
- 지원: GitHub Issues, 앱 내 "문제 보고", 문서, 변경 로그 및 도움말 페이지가 있는 공개 웹사이트.
- 기여:
AGENTS.md및CLAUDE.md의 가이드라인을 따르십시오. 플랫폼별 동작을 명시하고 Windows에서 CPU 안전한 메인 프로세스를 유지하십시오.
결론
Voicetypr는 Whisper 기반 음성 인식을 로컬에서 실행하여 개인정보 보호를 우선시하면서도 클라우드 및 LLM 기반 포맷팅을 선택적 추가 기능으로 제공하는 완전 오픈 소스 크로스 플랫폼 받아쓰기 앱입니다. CLI를 통해 자동화 및 AI 에이전트 워크플로우에 유용하며, Rust 코어와 React UI 아키텍처를 통해 현대적인 UI와 네이티브 성능을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트