233stone/vocotype-cli
VocoType 是一款运行在本地端侧的隐私安全语音输入工具,通过快捷键即可将语音实时转换为文字并自动输入到当前应用。支持语音转文字MCP、AI 优化文本、自定义替换词典、录音视频转文字等功能,让语音输入更高效、更安全。
VocoType CLI – 离线语音转文字引擎
简介
- 这是 VocoType 语音输入系统的开源命令行版本。它完全在用户电脑上运行,实时将语音转换为文字,无需将任何音频发送到云端。
- 基于 FunASR 离线识别器(阿里巴巴/达摩院)构建,并可选择使用火山引擎的 BigASR 云端服务。
核心功能
| 功能 | 详细说明 |
|---|---|
| 离线推理 | 使用约 500 MB 的 FunASR 模型,仅需 CPU 即可运行(约 700 MiB RAM)。无需 GPU。 |
| 快速响应 | 本地推理延迟约为 0.1 秒。 |
| 中英混合转录 | 处理双语输入,适用于技术术语。 |
| AI 驱动后处理 | 在原始 ASR 输出后,通过轻量级 AI 模型(由提示词模板选择)修正同音字、错别字及口语编辑指令,如“改成 …”。 |
| 自定义替换词典 | 最多可定义 20 个用户自定词汇(如人名、术语),强制纳入最终转录结果。 |
| 可选云端后端 | 可通过在 config.json 中提供 App Key 和 Access Key 切换至火山引擎 BigASR。 |
| 数据集导出 | 使用 --save-dataset 标志将捕获的音频-文字对写入磁盘,以便进行后续训练或分析。 |
目标用户
- 需要隐私保护听写工具的专业人士(作家、律师、医生、研究人员)。
- 希望为自己的应用程序加入可编程语音输入组件的开发者。
- 偏好可编写脚本或集成至自定义工作流程的 CLI 用户。
安装与快速入门
# Clone the repo
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli
# Create a Python 3.12 virtual environment (uv is recommended)
pip install uv
uv venv --python 3.12
source .venv/bin/activate # Windows: .\.venv\Scripts\activate
# Install Python dependencies
uv pip install -r requirements.txt
# First run – the script will download the ~500 MB FunASR model automatically
python main.py
- 若要录音并转录,只需运行
python main.py并对着默认麦克风说话。 - 若要导出捕获的音频-文字对:
python main.py --save-dataset。 - 若要使用火山引擎云端识别器,请创建包含 README 中所示凭证的
config.json,并使用python main.py --config config.json启动。
获取完整桌面体验 此 CLI 专为开发者设计。非技术用户请参考免费的图形化 VocoType 桌面客户端(Windows/macOS 下载链接位于仓库的 README 中)。
项目维护
- 发布版本皆有标签(如 v1.6.0),并包含 Windows 和 macOS 的预先构建安装程序。
- 仓库列出了主要依赖项(FunASR、可选的火山引擎 SDK)并提供清晰的设置说明。
- 问题与功能请求通过 GitHub Issues 处理。
项目意义 VocoType-CLI 展示了高质量语音识别可以在普通硬件上本地运行,为仅限云端的听写服务提供了一种隐私优先的替代方案,同时也为需要大型模型高准确度的用户保留了云端后端选项。
相关
- 项目
- 项目
- 项目
- 项目