altunenes/parakeet-rs
very fast speech-to-text, diarization, streaming (even in CPU) with NVIDIA Parakeet in Rust
What it solves
parakeet-rs 是一个 Rust 库,提供使用 NVIDIA Parakeet 模型与 Cohere Transcribe 通过 ONNX Runtime 的快速、高性能语音识别 (ASR) 和说话人分割功能。它让开发者能够直接在 Rust 应用程序中集成先进的语音转文字能力——包括流式、多语言支持和多说话人识别——而无需自行管理复杂的 AI 模型部署。
How it works
该库充当 ONNX Runtime 的包装器,使各种预训练模型得以运行。支持多种模型架构:
- CTC/TDT:离线转录,提供 token 级别的时间戳。
- EOU (End-of-Utterance):实时流式 ASR,检测说话者何时停止说话。
- Nemotron:具缓存感知的流式 ASR,支持标点和大小写,提供英文单语种和多语言变体。
- Multitalker:流式多说话人 ASR,将转录归属到特定说话者。
- Sortformer:流式说话人分割(识别最多 4 位说话者的发言时段)。
- Cohere Transcribe:离线多语言长音频转录。
Who it’s for
需要在软件中实现语音识别或说话人分割的 Rust 开发者,尤其是追求低延迟流式 ASR 或在 CPU、CUDA、TensorRT、WebGPU 上执行高性能本地推理的用户。
Highlights
- 多样模型支持:整合 NVIDIA Parakeet 与 Cohere 模型,满足流式与离线等各种使用场景。
- 硬件加速:支持多种执行提供者,包括 CUDA、TensorRT、WebGPU、DirectML 与 CPU。
- 大小写与标点:Nemotron 模型可生成具有正确大小写和标点的精致输出。
- 说话人归属:结合 ASR 与 Sortformer,实现说话人分割和多说话人转录。
- Token 级别时间戳:在 CTC 与 TDT 模型中提供每个词/ token 的精确时间信息。