Blaizzy/mlx-audio-swift
A modular Swift SDK for audio processing with MLX on Apple Silicon
What it solves
MLX Audio Swift 提供了一个统一且模块化的 Swift SDK,用于将先进的音频 AI 能力集成到 macOS 和 iOS 应用中。它消除了对复杂 Python 环境的需求,通过允许开发者直接在 Apple Silicon 上使用 MLX 框架运行高性能音频模型——包括文本转语音、语音转文本以及说话人日志——从而实现无缝集成。
How it works
该 SDK 被组织成模块化的组件,开发者可以单独导入以保持应用体积较小。它利用 MLX 框架在 Apple Silicon 上进行硬件加速,并与 HuggingFace Hub 集成以实现自动模型下载。该系统支持多种专门的流水线:
- TTS (Text-to-Speech): 将文本转换为音频波形。
- STT (Speech-to-Text): 将音频转录为文本。
- -VAD/Diarization: 检测语音活动并识别录音中的不同说话人。
- Codecs: 将音频编码并解码为 token 以进行高效处理。
- STS (Speech-to-Speech): 处理音频到音频的转换。
Who it’s for
想要在不依赖外部 API 或 Python 的情况下,实现设备端 AI 音频处理的 macOS (14+) 和 iOS (17+) Swift 开发者。
Highlights
Modular Design: 仅导入项目所需的特定模块 (例如:
MLXAudioTTS、MLXAudioSTT)。Extensive Model Support: 兼容包括 Whisper、Qwen3 和 Fish Audio 在内的广泛模型。
Apple Silicon Optimized: 专为使用 MLX Swift 的 M-series 芯片打造。
Sreaming Support: 为 TTS 提供实时音频生成能力。
SwiftUI Integration: 包含一个专门的
MLXAudioUI模块,用于构建音频界面。
相关
- 项目
- 项目
- 项目
- 项目
- 项目