Blaizzy/mlx-audio
A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.
解決的問題
MLX-Audio 提供專門針對 Apple Silicon(M 系列晶片)優化的高性能音訊處理函式庫。它簡化了用於文字轉語音 (TTS)、語音轉文字 (STT) 和語音轉語音 (STS) 任務的複雜音訊 AI 模型部署,讓使用者能夠高效地在本地執行這些模型。
工作原理
該函式庫基於 Apple 的 MLX 框架構建,整合了來自社群的各種預訓練模型。它支援多種模態,包括:
- Text-to-Speech (TTS): 從文字生成自然的語音,支援語音複製、多語言輸出和情感控制。
- Speech-to-Text (STT): 將音訊轉錄為文字,包括字詞級對齊、說話者分割(識別誰在說話)和串流轉錄。
- Speech-to-Speech (STS): 處理音源分離、語音增強和雜訊抑制等任務。
- VAD/Diarization: 偵測語音活動並分離不同的說話者。
適用對象
- 為 macOS 和 iOS 開發以音訊為核心的應用程式的開發者。
- 希望在 Apple 硬體上執行最先進音訊模型的研究人員。
- 需要快速、本地且私密的音訊處理,而不依賴雲端 API 的使用者。
亮點
- Apple Silicon 優化: 為 M 系列晶片量身打造的快速推論。
- 相容 API: 包含與 OpenAI 相容的 REST API 和具備 3D 音訊視覺化功能的網頁介面。
- 廣泛的模型支援: 整合了 Whisper、Kokoro、Qwen3-TTS 和 VibeVoice-ASR 等數十種模型。
- C 級整合: 提供用於原生 iOS/macOS 整合的 Swift 套件。
- 效能調優: 支援量化(3-bit 到 8-bit),以減少記憶體使用量並提高速度。