kstonekuan/tambourine-voice

Your personal voice interface for any app. Speak naturally and your words appear wherever your cursor is, with fully customizable AI voice dictation. Open source alternative to Wispr Flow.

해결하는 문제

Tambourine은 사용자가 컴퓨터의 어떤 애플리케이션에도 음성으로 텍스트를 입력할 수 있는 유니버설 음성-텍스트 인터페이스를 제공합니다. 내장된 음성 인식 도구의 한계를 극복하여, 높은 개인화, 불필요한 말투 제거 기능, 다양한 AI 제공업체를 활용한 음성 인식 및 포맷팅의 유연성을 제공합니다.

작동 방식

이 시스템은 Tauri 기반 데스크톱 앱과 Python 서버로 구성됩니다. 사용자가 핫키를 트리거하면 앱은 오디오를 캡처하고 WebRTC를 통해 서버로 스트리밍합니다. 서버는 음성 인식(STT) 제공업체를 사용해 오디오를 텍스트로 변환한 후, 대규모 언어 모델(LLM)을 통해 불필요한 말투를 제거하고, 구두점을 추가하며 사용자 정의 포맷팅 규칙을 적용합니다. 최종적으로 정제된 텍스트는 커서 위치에 자동으로 활성 애플리케이션에 입력됩니다.

대상 사용자

타이핑보다 빠르게 아이디어를 기록하고 싶은 사용자, 전문적 또는 기술적 워크플로우에 대해 매우 사용자 정의 가능한 음성 인터페이스가 필요한 사용자, 그리고 프로퍼라이어터리 음성 입력 소프트웨어의 오픈소스 대안을 선호하는 사용자에게 적합합니다.

주요 기능

  • 유니버설 호환성: 이메일, 메시지, 문서, 코드 에디터, 터미널 등 다양한 애플리케이션에서 작동합니다.
  • 유연한 AI 백엔드: Deepgram, Groq, OpenAI 등의 STT 제공업체와 Anthropic, Gemini, Cerebras 등의 LLM 제공업체를 지원하며, Whisper와 Ollama를 통해 완전히 로컬로 작동하는 옵션도 제공합니다.
  • 문맥 인식 포맷팅: 현재 포커스된 애플리케이션을 자동 감지하여 출력 스타일을 맞춤화합니다 (예: 이메일은 공식적, 메시지는 캐주얼).
  • 사용자 정의 제어: 사용자가 자체 포맷팅 프롬프트를 정의하고 기술 용어용 개인 사전을 유지할 수 있습니다.
  • 이중 모드 녹음: 글로벌 핫키를 통해 "압력 유지 녹음" 및 "토글" 모드를 모두 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트