Blaizzy/mlx-audio-swift
A modular Swift SDK for audio processing with MLX on Apple Silicon
What it solves
MLX Audio Swiftは、高度なオーディオAI機能をmacOSおよびiOSアプリケーションに統合するための、統一されたモジュール式Swift SDKを提供します。Python環境の複雑なセットアップを必要とせず、MLXフレームワークを使用してApple Silicon上で高性能-オーディオモデル(テキスト読み上げ、音声文字起こし、話者分離を含む)を直接実行できるようにします。
How it works
このSDKは、アプリケーションのサイズを小さく保つために、開発者が個別にインポートできるモジュール式コンポーネントに構成されています。Apple Silicon上でのハードウェアアクセラレーションのためにMLXフレームワークを活用し、HuggingFace Hubと連携してモデルの自動ダウンロードを実現します。本システムは、いくつかの専門的なパイプラインをサポートしています:
- TTS (Text-to-Speech): テキストをオーディオ波形に変換します。
- STT (Speech-to-Text): 音声をテキストに書き起こします。
- VAD/Diarization: 音声活動を検出し、録音内の異なる話者を識別します。
- Codecs: オーディオをトークンにエンコード/デコードします、効率的な処理のため。
- STS (Speech-to-Speech): オーディオからオーディオへの変換を処理します。
Who it’s for
macOS (14+) および iOS (17+) 向けのオーディオ中心のアプリケーションを構築するSwift開発者で、外部APIやPythonに依存せずにデバイス上でのAIオーディオ処理を実装したいと考えている方。
Highlights
- Modular Design: プロジェクトに必要な特定のモジュール (例:
MLXAudioTTS、MLXAudioSTT) のみをインポートできます。 - Extensive Model Support: Whisper, Qwen3, Fish Audio を含む幅広いモデルに対応しています。
- Apple Silicon Optimized: MLX Swiftを使用して、M-seriesチップに特化して構築されています。
- Sreaming Support: TTSのためのリアルタイムオーディオ生成が可能です。
- SwiftUI Integration: オーディオインターフェースを構築するための専用の
MLXAudioUIモジュールが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト