senstella/parakeet-mlx

An implementation of the Nvidia's Parakeet models for Apple Silicon using MLX.

解决的问题

它提供了一种在 Apple Silicon 硬件上使用 MLX 框架运行 Nvidia 的 Parakeet 自动语音识别(ASR)模型的方法,从而实现高效的本地音频转录。

工作原理

该项目在 MLX 中实现了 Parakeet 模型架构,允许用户从 Hugging Face 加载预训练权重。它支持多种模型变体(TDT、RNNT、CTC、TDTCTC),并提供多种解码方法,例如贪婪解码和束搜索。为了处理长音频文件,它包含了分块机制和局部注意力,以减少内存使用。

适用人群

需要高性能、本地语音转文字转录功能,并支持时间戳和流式音频的 Apple Silicon Mac 开发者和用户。

特色亮点

  • 多种输出格式:支持将转录结果导出为 TXT、SRT、VTT 和 JSON 格式。
  • 精确的时间戳:提供音频的词级和句子级对齐信息。
  • 流式支持:包含 transcribe_stream 方法,支持实时转录。
  • 灵活的解码方式:为 TDT 模型提供可配置的束搜索参数(束大小、长度惩罚、耐心度)。
  • 内存优化:通过实现局部注意力,可在不产生过度内存消耗的情况下处理长音频序列。

相关

  • 项目
  • 项目
  • 项目
  • 项目