senstella/parakeet-mlx
An implementation of the Nvidia's Parakeet models for Apple Silicon using MLX.
解决的问题
它提供了一种在 Apple Silicon 硬件上使用 MLX 框架运行 Nvidia 的 Parakeet 自动语音识别(ASR)模型的方法,从而实现高效的本地音频转录。
工作原理
该项目在 MLX 中实现了 Parakeet 模型架构,允许用户从 Hugging Face 加载预训练权重。它支持多种模型变体(TDT、RNNT、CTC、TDTCTC),并提供多种解码方法,例如贪婪解码和束搜索。为了处理长音频文件,它包含了分块机制和局部注意力,以减少内存使用。
适用人群
需要高性能、本地语音转文字转录功能,并支持时间戳和流式音频的 Apple Silicon Mac 开发者和用户。
特色亮点
- 多种输出格式:支持将转录结果导出为 TXT、SRT、VTT 和 JSON 格式。
- 精确的时间戳:提供音频的词级和句子级对齐信息。
- 流式支持:包含
transcribe_stream方法,支持实时转录。 - 灵活的解码方式:为 TDT 模型提供可配置的束搜索参数(束大小、长度惩罚、耐心度)。
- 内存优化:通过实现局部注意力,可在不产生过度内存消耗的情况下处理长音频序列。
相关
- 项目
- 项目
- 项目
- 项目