transcribe.cpp: 一个高性能的 C/C++ 语音转文本推理库,支持数十种模型族和 GPU 加速
transcribe.cpp: 一个高性能的 C/C++ 语音转文本推理库,支持数十种模型族和 GPU 加速
它解决的问题
transcribe.cpp 是一个高性能的 C/C++ 语音转文本(STT)推理库,旨在跨各种硬件平台运行多种模型族。它提供了一种统一的方式来在硬件加速下执行转录模型,减少对重型框架的依赖,同时保持高准确率(WER 测试)。
它是如何工作的
该库使用 ggml 运行时和 GGUF 模型格式来执行推理。它支持多种硬件后端以实现快速 GPU 加速,包括 Metal(Apple Silicon)、Vulkan(Linux/Windows)和 CUDA(NVIDIA),以及由 tinyBLAS 加速的 CPU 路径。它还包含用于将 NVIDIA NeMo 检查点转换为 GGUF 并将模型量化以减小大小的工具(例如 Q4_K_M、Q8_0)。
适用人群
需要在不同操作系统和硬件上将快速的本地语音转文本功能集成到其应用程序中的开发者,以及那些寻找轻量级、便携式 ASR 模型推理引擎的人。
亮点
- 广泛的模型支持:支持 16 种模型族和超过 60 种变体,包括 Whisper、Parakeet、Canary 和 Qwen3-ASR。
- 跨平台加速:对 Metal、Vulkan 和 CUDA 后端提供原生支持。
- 高保真:每个已发布的模型在数值上经过验证,并在参考实现上进行了 Word Error Rate(WER)测试。
- 多语言绑定:官方绑定可用于 Python、TypeScript/JavaScript、Rust 和 Swift。
- 灵活推理:支持流式和批量转录。