ideaplexa/voicetypr

Voicetypr - AI powered offline voice to text dictation tool for busy founders, vibe coders, AI power users on macos, windows. Alternative to wispr flow and superwhisper.

Voicetypr이란 무엇인가요?

Voicetypr는 macOS 및 Windows를 위한 오프라인 우선 데스크톱 받아쓰기 도구입니다. 컴퓨터 어디에서나 음성으로 입력할 수 있으며, 로컬 또는 선택적 클라우드 음성 인식 모델을 사용하여 오디오를 전사하고 결과 텍스트를 커서 위치에 바로 삽입합니다.


핵심 아이디어 (README에서)

아이디어 의미
시스템 전체 받아쓰기 전역 단축키로 녹음을 시작/중지할 수 있어 모든 앱(이메일, 코드 에디터, 브라우저 등)에서 받아쓰기가 가능합니다.
기본 로컬 전사 OpenAI-Whisper(macOS 및 Windows)와 Apple Silicon에 최적화된 Parakeet 모델을 사용합니다. 클라우드 제공업체를 선택하지 않는 한 인터넷 트래픽이 발생하지 않습니다.
선택적 클라우드 제공업체 다른 서비스를 선호하는 경우 Soniox, OpenAI, Groq, Deepgram 또는 Cohere를 지정할 수 있습니다.
AI 포맷팅 전사 후 원본 텍스트를 LLM(OpenAI, Anthropic, Gemini 또는 OpenAI 호환 엔드포인트)을 통해 정리할 수 있습니다.
CLI 및 에이전트 통합 voicetypr 명령줄 도구를 통해 스크립트나 자율 에이전트가 동일한 전사 파이프라인에 액세스하여 일반 텍스트나 구조화된 JSON을 받을 수 있습니다.
네트워크 공유 하나의 Voicetypr 인스턴스가 LAN상의 개인 전사 서버 역할을 하여 다른 설치 환경에서 작업을 오프로드할 수 있습니다.
로컬 모델 평생 라이선스 체험 기간 후 일회성 라이선스를 구매하면 로컬 실행 모델에 대한 분당 비용이 발생하지 않습니다.

주요 기능

  • 전역 단축키, 푸시 투 토크, 녹음 토글, 커서 자동 삽입
  • Whisper(macOS/Windows) + Parakeet(Apple Silicon)을 통한 기기 내 전사
  • 클라우드 STT 옵션 (Soniox, OpenAI, Groq, Deepgram, Cohere)
  • OpenAI/Anthropic/Gemini 또는 사용자 지정 엔드포인트를 통한 LLM 기반 텍스트 다듬기
  • 오디오/비디오 파일 전사; 클라우드 제공업체를 통한 화자 분리(diarization) 가능
  • 검색, 메타데이터, 원본 vs 포맷팅 비교, 복사 또는 재전사 기능을 포함한 기록 보기
  • LAN 기반 개인 전사 서버 (네트워크 공유)
  • 에이전트 지원 CLI (voicetypr transcribe … --json 등)
  • 안정/베타 업데이트 채널; Microsoft Store 버전은 스토어 업데이트 준수
  • 오디오 캡처, 단축키, 커서 삽입을 처리하는 Rust 기반의 가벼운 React UI

사용 방법

  1. 설치 – macOS 14+ DMG 또는 Windows 설치 프로그램 / Microsoft Store.
  2. 권한 부여 – 마이크 권한 및 (macOS) 커서 삽입을 위한 접근성 권한.
  3. 모델 다운로드 – 앱이 Whisper/Parakeet 파일을 한 번 가져와 로컬에 저장합니다.
  4. 단축키 설정 – 설정 → 일반에서 전역 단축키를 선택합니다.
  5. 받아쓰기 – 텍스트 필드에 커서를 두고 단축키를 누른 뒤 말하고 멈춥니다.
  6. 결과 – Voicetypr이 커서 위치에 전사 내용을 입력하고 기록에 저장합니다.

명령줄 인터페이스 (CLI)

CLI는 스크립트나 AI 에이전트를 위해 GUI 기능을 미러링합니다:

voicetypr status --json          # 상태 정보
voicetypr models --json          # 사용 가능한 로컬/클라우드 모델 목록
voicetypr transcribe --file note.wav --json   # 파일 → 텍스트/JSON
voicetypr record --until-silence --json       # 실시간 마이크 캡처

기본 출력은 사람이 읽기 쉬운 형식이며, --json은 자동화에 적합한 구조화된 객체를 반환합니다. 원격 서버나 클라우드 제공업체를 명시적으로 요청하지 않는 한 오디오는 기기를 떠나지 않습니다.


개인정보 보호 및 데이터 흐름

모드 컴퓨터를 떠나는 데이터
로컬 전사 없음 – 오디오와 텍스트는 기기에 유지됩니다.
클라우드 전사 녹음된 오디오가 선택한 STT 제공업체로 전송됩니다.
AI 포맷팅 원본 전사 내용이 구성된 LLM 서비스로 전송됩니다.
네트워크 공유 오디오가 구성한 Voicetypr 서버(LAN 또는 기타 네트워크)로 전송됩니다.
진단 및 분석은 설정에서 토글할 수 있으며, 프로젝트의 개인정보 보호 정책에 보관 기간이 자세히 설명되어 있습니다.

기술 스택

  • 데스크톱 셸: Tauri v2 (Rust + webview) - 네이티브 윈도우, 자동 업데이트, 권한 관리.
  • 프론트엔드: React 19, TypeScript, Tailwind CSS, shadcn/ui, Zustand 상태 관리.
  • 백엔드: Rust - 오디오 캡처, 리샘플링, 단축키, 전사 오케스트레이션, 기록, 커서 삽입.
  • 로컬 엔진: Whisper (CPU) - 양 OS 지원; Parakeet (Apple Silicon); Vulkan 가속 Whisper (Windows 옵션).
  • 네트워크 공유: 동일한 Rust 백엔드 위에 구축된 인증된 클라이언트/서버.

코드 가져오기 및 직접 빌드

git clone https://github.com/ideaplexa/voicetypr.git
cd voicetypr
pnpm install               # Node + React 의존성
pnpm tauri:dev             # 개발 모드 실행 (Rust 툴체인, Tauri 필수 요소 필요)

필수 요소: Node + pnpm, Rust stable, Tauri v2 플랫폼 도구, Xcode CLI (macOS) 또는 Visual Studio Build Tools (Windows). Lint, 타입 체크, 테스트 스크립트 (pnpm lint, pnpm test 등)가 제공됩니다.


라이선스 및 커뮤니티

  • 라이선스: GNU Affero General Public License v3 (AGPL-3.0).
  • 지원: GitHub Issues, 앱 내 "문제 보고", 문서, 변경 로그 및 도움말 페이지가 있는 공개 웹사이트.
  • 기여: AGENTS.mdCLAUDE.md의 가이드라인을 따르십시오. 플랫폼별 동작을 명시하고 Windows에서 CPU 안전한 메인 프로세스를 유지하십시오.

결론

Voicetypr는 Whisper 기반 음성 인식을 로컬에서 실행하여 개인정보 보호를 우선시하면서도 클라우드 및 LLM 기반 포맷팅을 선택적 추가 기능으로 제공하는 완전 오픈 소스 크로스 플랫폼 받아쓰기 앱입니다. CLI를 통해 자동화 및 AI 에이전트 워크플로우에 유용하며, Rust 코어와 React UI 아키텍처를 통해 현대적인 UI와 네이티브 성능을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트