ideaplexa/voicetypr
Voicetypr - AI powered offline voice to text dictation tool for busy founders, vibe coders, AI power users on macos, windows. Alternative to wispr flow and superwhisper.
什么是 Voicetypr?
Voicetypr 是一款适用于 macOS 和 Windows 的 优先离线桌面听写工具。它让您可以在电脑上的任何地方说话,使用本地或可选的云端语音转文字模型转录音频,并将生成的文本直接插入光标位置。
核心理念 (来自 README)
| 理念 | 含义 |
|---|---|
| 全系统听写 | 全局热键可启动/停止录音,因此您可以对任何应用程序(电子邮件、代码编辑器、浏览器等)进行听写。 |
| 默认本地转录 | 使用 OpenAI-Whisper (macOS 和 Windows) 以及针对 Apple Silicon 优化的 Parakeet 模型。除非您选择云端提供商,否则不会有互联网流量。 |
| 可选云端提供商 | 如果您偏好其他服务,可以将 Voicetypr 指向 Soniox、OpenAI、Groq、Deepgram 或 Cohere。 |
| AI 格式化 | 转录后,原始文本可以由 LLM(OpenAI、Anthropic、Gemini 或任何兼容 OpenAI 的端点)进行清理。 |
| CLI 与代理集成 | voicetypr 命令行工具让脚本或自主代理能够访问相同的转录管道,并返回纯文本或结构化 JSON。 |
| 网络共享 | 一个 Voicetypr 实例可以作为您局域网上的私人转录服务器,让其他安装程序分担工作。 |
| 本地模型终身授权 | 试用期后,您可以购买一次性授权,免除本地运行模型的所有每分钟费用。 |
主要功能 (列表)
- 全局快捷键、按键通话、切换录音、光标处自动插入
- Whisper (macOS/Windows) + Parakeet (Apple Silicon) 用于设备端转录
- 云端 STT 选项 (Soniox, OpenAI, Groq, Deepgram, Cohere)
- 通过 OpenAI/Anthropic/Gemini 或自定义端点进行基于 LLM 的文本润色
- 转录音频/视频文件;云端提供商可增加说话者识别 (diarization)
- 历史记录视图,包含搜索、元数据、比较原始与格式化文本、复制或重新转录
- 基于局域网的私人转录服务器 (网络共享)
- 支持代理的 CLI (
voicetypr transcribe … --json等) - 稳定版/测试版更新频道;Microsoft Store 版本遵循商店更新
- 小型 React UI,由 Rust 支持音频捕获、热键和光标插入
如何使用
- 安装 – macOS 14+ DMG 或 Windows 安装程序 / Microsoft Store。
- 授予权限 – 麦克风权限,以及 (macOS) 用于光标插入的辅助功能权限。
- 下载模型 – 应用程序会一次性获取 Whisper/Parakeet 文件并存储在本地。
- 设置热键 – 在“设置”→“常规”中选择全局快捷键。
- 听写 – 将光标置于任何文本字段,按下快捷键,说话,停止。
- 结果 – Voicetypr 会在光标处输入转录内容并保存到历史记录中。
命令行界面 (CLI)
CLI 为脚本或 AI 代理镜像了 GUI 功能:
voicetypr status --json # 健康信息
voicetypr models --json # 列出可用的本地/云端模型
voicetypr transcribe --file note.wav --json # 文件 → 文本/JSON
voicetypr record --until-silence --json # 即时麦克风捕获
默认输出为人类可读格式;--json 产生适合自动化的结构化对象。除非您明确请求远程服务器或云端提供商,否则音频永远不会离开机器。
隐私与数据流
| 模式 | 离开电脑的数据 |
|---|---|
| 本地转录 | 无 – 音频和文本保留在设备上。 |
| 云端转录 | 录制的音频会传送到所选的 STT 提供商。 |
| AI 格式化 | 原始转录内容会传送到配置的 LLM 服务。 |
| 网络共享 | 音频会传送到您配置的 Voicetypr 服务器(局域网或其他网络)。 |
| 诊断和分析可以在“设置”中切换;项目的隐私政策详细说明了保留期限。 |
技术堆栈
- 桌面壳层: Tauri v2 (Rust + webview),用于原生窗口化、自动更新、权限管理。
- 前端: React 19, TypeScript, Tailwind CSS, shadcn/ui, Zustand 状态管理。
- 后端: Rust 处理音频捕获、重采样、热键、转录编排、历史记录、光标插入。
- 本地引擎: 两个操作系统上的 Whisper (CPU);Apple Silicon 上的 Parakeet 侧车;Windows 上可选的 Vulkan 加速 Whisper 侧车。
- 网络共享: 建立在相同 Rust 后端上的认证客户端/服务器。
获取代码并自行构建
git clone https://github.com/ideaplexa/voicetypr.git
cd voicetypr
pnpm install # Node + React 依赖
pnpm tauri:dev # 在开发模式下运行 (需要 Rust 工具链, Tauri 先决条件)
先决条件:Node + pnpm, Rust stable, Tauri v2 平台工具, Xcode CLI (macOS) 或 Visual Studio Build Tools (Windows)。提供 Lint、类型检查和测试脚本 (pnpm lint, pnpm test 等)。
授权与社区
- 授权: GNU Affero General Public License v3 (AGPL-3.0)。
- 支持: GitHub Issues、应用程序内“报告问题”,以及包含文档、更新日志和帮助页面的公共网站。
- 贡献: 遵循
AGENTS.md和CLAUDE.md中的指南;保持平台特定行为明确,并维护 Windows 上 CPU 安全的主程序。
总结
Voicetypr 是一款完全开源、跨平台的听写应用程序,通过在本地运行基于 Whisper 的语音转文字来优先考虑隐私,同时仍提供云端和基于 LLM 的格式化作为可选附加组件。其 CLI 使其适用于自动化和 AI 代理工作流程,且其架构(Rust 核心 + React UI)以现代化 UI 提供了原生性能。
相关
- 项目
- 项目
- 项目
- 项目