kstonekuan/tambourine-voice

Your personal voice interface for any app. Speak naturally and your words appear wherever your cursor is, with fully customizable AI voice dictation. Open source alternative to Wispr Flow.

解决的问题

Tambourine 提供一个通用的语音转文字接口,允许用户将语音输入到计算机上的任意应用程序中。它克服了原生语音输入工具的局限性,提供高度个性化、可去除填充词、并支持使用多种 AI 提供商进行语音识别和格式化处理的灵活性。

工作原理

该系统由基于 Tauri 的桌面应用程序和 Python 服务器组成。当用户触发快捷键时,应用程序会捕获音频,并通过 WebRTC 将其流式传输到服务器。服务器使用语音转文字(STT)提供商将音频转录为文本,然后通过大型语言模型(LLM)清理填充词、添加标点符号并应用自定义格式规则。最终润色后的文本会自动在当前活动应用程序的光标位置输入。

适用人群

适用于希望比打字更快记录想法的用户,需要高度可定制的语音界面以应对专业或技术工作流的用户,以及偏好开源替代品而非专有语音输入软件的用户。

主要亮点

  • 通用兼容性:适用于邮件、消息、文档、代码编辑器和终端等各类应用。
  • 灵活的 AI 后端:支持多种 STT(如 Deepgram、Groq、OpenAI)和 LLM(如 Anthropic、Gemini、Cerebras)提供商,包括通过 Whisper 和 Ollama 实现的完全本地化选项。
  • 上下文感知格式化:自动检测当前聚焦的应用程序,以调整输出风格(例如,邮件使用正式风格,消息使用随意风格)。
  • 可自定义控制:用户可定义自己的格式化提示,并维护个人技术术语词典。
  • 双模式录音:通过全局快捷键提供“按住录音”和“切换”两种模式。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目