233stone/vocotype-cli

VocoType 是一款运行在本地端侧的隐私安全语音输入工具,通过快捷键即可将语音实时转换为文字并自动输入到当前应用。支持语音转文字MCP、AI 优化文本、自定义替换词典、录音视频转文字等功能,让语音输入更高效、更安全。

VocoType CLI – 离线语音转文字引擎

简介

  • 这是 VocoType 语音输入系统的开源命令行版本。它完全在用户电脑上运行,实时将语音转换为文字,无需将任何音频发送到云端。
  • 基于 FunASR 离线识别器(阿里巴巴/达摩院)构建,并可选择使用火山引擎的 BigASR 云端服务。

核心功能

功能 详细说明
离线推理 使用约 500 MB 的 FunASR 模型,仅需 CPU 即可运行(约 700 MiB RAM)。无需 GPU。
快速响应 本地推理延迟约为 0.1 秒。
中英混合转录 处理双语输入,适用于技术术语。
AI 驱动后处理 在原始 ASR 输出后,通过轻量级 AI 模型(由提示词模板选择)修正同音字、错别字及口语编辑指令,如“改成 …”。
自定义替换词典 最多可定义 20 个用户自定词汇(如人名、术语),强制纳入最终转录结果。
可选云端后端 可通过在 config.json 中提供 App KeyAccess Key 切换至火山引擎 BigASR。
数据集导出 使用 --save-dataset 标志将捕获的音频-文字对写入磁盘,以便进行后续训练或分析。

目标用户

  • 需要隐私保护听写工具的专业人士(作家、律师、医生、研究人员)。
  • 希望为自己的应用程序加入可编程语音输入组件的开发者。
  • 偏好可编写脚本或集成至自定义工作流程的 CLI 用户。

安装与快速入门

# Clone the repo
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli

# Create a Python 3.12 virtual environment (uv is recommended)
pip install uv
uv venv --python 3.12
source .venv/bin/activate   # Windows: .\.venv\Scripts\activate

# Install Python dependencies
uv pip install -r requirements.txt

# First run – the script will download the ~500 MB FunASR model automatically
python main.py
  • 若要录音并转录,只需运行 python main.py 并对着默认麦克风说话。
  • 若要导出捕获的音频-文字对:python main.py --save-dataset
  • 若要使用火山引擎云端识别器,请创建包含 README 中所示凭证的 config.json,并使用 python main.py --config config.json 启动。

获取完整桌面体验 此 CLI 专为开发者设计。非技术用户请参考免费的图形化 VocoType 桌面客户端(Windows/macOS 下载链接位于仓库的 README 中)。

项目维护

  • 发布版本皆有标签(如 v1.6.0),并包含 Windows 和 macOS 的预先构建安装程序。
  • 仓库列出了主要依赖项(FunASR、可选的火山引擎 SDK)并提供清晰的设置说明。
  • 问题与功能请求通过 GitHub Issues 处理。

项目意义 VocoType-CLI 展示了高质量语音识别可以在普通硬件上本地运行,为仅限云端的听写服务提供了一种隐私优先的替代方案,同时也为需要大型模型高准确度的用户保留了云端后端选项。

相关

  • 项目
  • 项目
  • 项目
  • 项目