Blaizzy/mlx-audio
A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.
解決する課題
MLX-Audioは、Apple Silicon(Mシリーズチップ)に特化して最適化された高性能なオーディオ処理ライブラリを提供します。テキスト読み上げ(TTS)、音声認識(STT)、音声変換(STS)タスクのための複雑なオーディオAIモデルのデプロイを簡素化し、ユーザーがこれらのモデルをローカルで高効率に実行できるようにします。
仕組み
AppleのMLXフレームワークに基づいて構築されたこのライブラリは、コミュニティからの幅広い学習済みモデルを統合しています。以下のマルチモーダルをサポートしています:
- Text-to-Speech (TTS): 音声クローニング、多言語出力、感情制御をサポートし、テキストから自然な音声を生成します。
- Speech-to-Text (STT): 単語レベルのアライメント、話者分離(誰が話しているかの特定)、ストリーミング文字起こしを含む、音声からテキストへの書き起こし。
- Speech-to-Speech (STS): 音源分離、音声強調、ノイズ抑制などのタスクを処理します。
- VAD/Diarization: 音声活動検知および話者の分離。
対象ユーザー
- macOSおよびiOS向けのオーディオ中心のアプリケーションを構築している開発者。
- Appleハードウェア上で最先端のオーディオモデルを実行したい研究者。
- クラウドAPIに依存せず、高速でローカルかつプライベートなオーディオ処理を必要とするユーザー。
ハイライト
- Apple Siliconに最適化: Mシリーズチップ向けに調整された高速な推論。
- 互換性のあるAPI: OpenAI互換のREST APIと、3Dオーディオ可視化を備えたウェブインターフェースが含まれています。
- 広範なモデルサポート: Whisper、Kokoro、Qwen3-TTS、VibeVoice-ASRなどの数十のモデルを統合。
- C-levelの統合: ネイティブなiOS/macOS統合のためのSwiftパッケージを提供。
- パフォーマンスチューニング: メモリ使用量を削減し速度を向上させるための量子化(3-bitから8-bit)をサポート。