Blaizzy/mlx-audio-swift
A modular Swift SDK for audio processing with MLX on Apple Silicon
What it solves
MLX Audio Swift 提供了一個統一且模組化的 Swift SDK,用於將先進的音訊 AI 能力整合至 macOS 與 iOS 應用程式中。它消除了對複雜 Python 環境的需求,讓開發者能直接在 Apple Silicon 上使用 MLX 框架執行高效率的音訊模型——包括文字轉語音、語音轉文字以及說話者分割。
How it works
此 SDK 被組織成模組化的組件,開發者可以個別導入,以保持應用程式的大小。它利用 MLX 框架在 Apple Silicon 上進行硬體加速,並與 HuggingFace Hub 整合以實現自動模型下載。該系統支援多種專業的處理流程:
- TTS (Text-to-Speech): 將文字轉換為音訊波形。
- STT (Speech-to-Text): 將音訊轉錄為文字。
- VAD/Diarization: 偵測語音活動並識別錄音中的不同說話者。
- Codecs: 將音訊編碼並解碼為 token 以進行高效處理。
- STS (Speech-to-Speech): 處理音訊到音訊的轉換。
Who it’s for
想要在不依賴外部 API 或 Python 的情況下,實作裝置端 AI 音訊處理的 macOS (14+) 與 iOS (17+) Swift 開發者。
Highlights
- Modular Design: 僅導入專案所需的特定模組 (例如:
MLXAudioTTS、MLXAudioSTT)。 - Extensive Model Support: 相容於包括 Whisper、Qwen3 與 Fish Audio 在內的廣泛模型。
- Apple Silicon Optimized: 專為使用 MLX Swift 的 M-series 晶片打造。
- Sreaming Support: 為 TTS 提供即時音訊生成能力。
- SwiftUI Integration: 包含一個專用的
MLXAudioUI模組,用於建立音訊介面。
相關
- 專案
- 專案
- 專案
- 專案
- 專案