Blaizzy/mlx-audio-swift

A modular Swift SDK for audio processing with MLX on Apple Silicon

What it solves

MLX Audio Swift 提供了一個統一且模組化的 Swift SDK,用於將先進的音訊 AI 能力整合至 macOS 與 iOS 應用程式中。它消除了對複雜 Python 環境的需求,讓開發者能直接在 Apple Silicon 上使用 MLX 框架執行高效率的音訊模型——包括文字轉語音、語音轉文字以及說話者分割。

How it works

此 SDK 被組織成模組化的組件,開發者可以個別導入,以保持應用程式的大小。它利用 MLX 框架在 Apple Silicon 上進行硬體加速,並與 HuggingFace Hub 整合以實現自動模型下載。該系統支援多種專業的處理流程:

  • TTS (Text-to-Speech): 將文字轉換為音訊波形。
  • STT (Speech-to-Text): 將音訊轉錄為文字。
  • VAD/Diarization: 偵測語音活動並識別錄音中的不同說話者。
  • Codecs: 將音訊編碼並解碼為 token 以進行高效處理。
  • STS (Speech-to-Speech): 處理音訊到音訊的轉換。

Who it’s for

想要在不依賴外部 API 或 Python 的情況下,實作裝置端 AI 音訊處理的 macOS (14+) 與 iOS (17+) Swift 開發者。

Highlights

  • Modular Design: 僅導入專案所需的特定模組 (例如:MLXAudioTTSMLXAudioSTT)。
  • Extensive Model Support: 相容於包括 Whisper、Qwen3 與 Fish Audio 在內的廣泛模型。
  • Apple Silicon Optimized: 專為使用 MLX Swift 的 M-series 晶片打造。
  • Sreaming Support: 為 TTS 提供即時音訊生成能力。
  • SwiftUI Integration: 包含一個專用的 MLXAudioUI 模組,用於建立音訊介面。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案