Blaizzy/mlx-audio
A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.
解决的问题
MLX-Audio 提供专门针对 Apple Silicon(M 系列芯片)优化的高性能音频处理库。它简化了用于文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 任务的复杂音频 AI 模型的部署,使用户能够高效地在本地运行这些模型。
工作原理
该库基于 Apple 的 MLX 框架构建,集成了社区提供的多种预训练模型。它支持多种模态,包括:
- Text-to-Speech (TTS): 从文本生成自然语音,支持语音克隆、多语言输出和情感控制。
- Speech-to-Text (STT): 将音频转录为文本,包括词级对齐、说话人日志(识别说话者)和流式转录。
- Speech-to-Speech (STS): 处理源分离、语音增强和噪声抑制等任务。
- VAD/Diarization: 检测语音活动并分离不同的说话人。
适用对象
- 为 macOS 和 iOS 构建以音频为核心的应用程序的开发者。
- 希望在 Apple 硬件上运行最先进音频模型的研究人员。
- 需要快速、本地且私密的音频处理,而不依赖云端 API 的用户。
亮点
- Apple Silicon 优化: 为 M 系列芯片量身定制的快速推理。
- 兼容 API: 包括与 OpenAI 兼容的 REST API 和带有 3D 音频可视化的 Web 界面。
- 广泛的模型支持: 集成了 Whisper、Kokoro、Qwen3-TTS 和 VibeVoice-ASR 等数十种模型。
- C 级集成: 提供用于原生 iOS/macOS 集成的 Swift 软件包。
- 性能调优: 支持量化(3-bit 到 8-bit),以减少内存占用并提高速度。