Blaizzy/mlx-audio-swift

A modular Swift SDK for audio processing with MLX on Apple Silicon

What it solves

MLX Audio Swiftは、高度なオーディオAI機能をmacOSおよびiOSアプリケーションに統合するための、統一されたモジュール式Swift SDKを提供します。Python環境の複雑なセットアップを必要とせず、MLXフレームワークを使用してApple Silicon上で高性能-オーディオモデル(テキスト読み上げ、音声文字起こし、話者分離を含む)を直接実行できるようにします。

How it works

このSDKは、アプリケーションのサイズを小さく保つために、開発者が個別にインポートできるモジュール式コンポーネントに構成されています。Apple Silicon上でのハードウェアアクセラレーションのためにMLXフレームワークを活用し、HuggingFace Hubと連携してモデルの自動ダウンロードを実現します。本システムは、いくつかの専門的なパイプラインをサポートしています:

  • TTS (Text-to-Speech): テキストをオーディオ波形に変換します。
  • STT (Speech-to-Text): 音声をテキストに書き起こします。
  • VAD/Diarization: 音声活動を検出し、録音内の異なる話者を識別します。
  • Codecs: オーディオをトークンにエンコード/デコードします、効率的な処理のため。
  • STS (Speech-to-Speech): オーディオからオーディオへの変換を処理します。

Who it’s for

macOS (14+) および iOS (17+) 向けのオーディオ中心のアプリケーションを構築するSwift開発者で、外部APIやPythonに依存せずにデバイス上でのAIオーディオ処理を実装したいと考えている方。

Highlights

  • Modular Design: プロジェクトに必要な特定のモジュール (例:MLXAudioTTSMLXAudioSTT) のみをインポートできます。
  • Extensive Model Support: Whisper, Qwen3, Fish Audio を含む幅広いモデルに対応しています。
  • Apple Silicon Optimized: MLX Swiftを使用して、M-seriesチップに特化して構築されています。
  • Sreaming Support: TTSのためのリアルタイムオーディオ生成が可能です。
  • SwiftUI Integration: オーディオインターフェースを構築するための専用の MLXAudioUI モジュールが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト