senstella/parakeet-mlx

An implementation of the Nvidia's Parakeet models for Apple Silicon using MLX.

What it solves

NvidiaのParakeet Automatic Speech Recognition (ASR) モデルをMLXフレームワークを使用してApple Siliconハードウェア上で実行する方法を提供し、効率的なローカル音声文字起こしを可能にします。

How it works

このプロジェクトはParakeetモデルアーキテクチャをMLXで実装しており、ユーザーはHugging Faceから学習済みウェイトをロードできます。TDT、RNNT、CTC、TDTCTCなどの様々なモデルバリアントをサポートし、greedyやbeam searchなどの複数のデコーディング手法を提供します。長い音声ファイルを扱うために、チャンク分割メカニズムとlocal attentionを含んでおり、メモリ使用量を削減します。

Who it’s for

タイムスタンプとストリーミング音声のサポートが必要な、高性能でローカルな音声からテキストへの文字起こしを必要とするApple Silicon搭載Macのデベロッパーおよびユーザー。

Highlights

  • Multiple Output Formats: TXT、SRT、VTT、およびJSONとして文字起こし結果をエクスポートすることをサポートします。
  • Precise Timestamps: 音声に対する単語レベルおよび文レベルのアライメントを提供します。
  • Streaming Support: リアルタイム文字起こし用の transcribe_stream メソッドを含んでいます。
  • Flexible Decoding: TDTモデル向けに、設定可能なbeam searchパラメータ(beam size、length penalty、patience)を提供します。
  • Memory Optimization: 過度なメモリ消費なしに長い音声シーケンスを扱うために、local attentionを実装しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト