Blaizzy/mlx-audio

A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.

MLX‑Audio – 高速、原生支持 Apple Silicon 的音频 AI 库

是什么 – 一个 Python 包(以及可选的 Swift 包),封装了大量前沿的语音和音乐模型,并在 Apple 的 MLX 框架上运行。它提供开箱即用的命令行工具、Python API、Web UI 和 OpenAI 兼容的 REST 端点,支持以下功能:

  • 文本转语音(TTS)
  • 语音转文本(STT / ASR)
  • 语音转语音 / 声源分离
  • 语音活动检测与说话人分离(VAD / Diarization)
  • 音乐生成
  • 3 至 8 位量化推理,适用于低内存的 Apple Silicon 设备

快速开始(CLI)

# 安装包
pip install mlx-audio   # 或:uv tool install mlx-audio

# 生成一段简短的 TTS 音频(默认语音 "Vivian")
mlx_audio.tts.generate \
    --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \
    --text "Hello, world!" \
    --play

添加 --stream 可在生成过程中实时收听音频,--save 可保存到磁盘,--join_audio 可将多段输出合并为单个文件。


快速开始(Python)

from mlx_audio.tts.utils import load_model

model = load_model("mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit")
for result in model.generate(
        "Hello from MLX‑Audio!",
        voice="Vivian",
        lang_code="English",
    ):
    # result.audio 是包含波形的 mx.array
    print("generated", result.audio.shape[0], "samples")

STT、VAD、分离等操作也使用相同的模式,只需使用对应的 mlx_audio.sttmlx_audio.vad 模块即可。


核心功能(来自 README)

  • Apple Silicon 优化 – 推理在 MLX 后端运行,可在 M 系列芯片上实现低延迟生成。
  • 广泛的模型目录 – Hugging Face 上托管了数十个预训练模型(如 Kokoro、OmniVoice、Qwen3‑TTS、Whisper、VAD、音乐生成模型),大多数模型提供 8 位、4 位或 3 位量化版本。
  • 多语言与语音克隆 – 多数模型支持 20 多种语言;多个模型(OmniVoice、Higgs Audio、CSM)可从参考音频片段中克隆说话人。
  • 流式与实时控制 – 支持 TTS 的 --stream 标志、流式 ASR 模型(如 Nemotron 3.5‑ASR‑streaming、VibeVoice‑ASR),以及全双工 VoiceChat。
  • Web UI – 交互式浏览器界面,支持 3D 音频可视化。
  • OpenAI 兼容 REST API – 可直接替换 OpenAI 的 audio/speech 端点。
  • 量化支持 – 支持 3、4、6、8 位(以及 MXFP 格式),使大模型适配笔记本电脑有限的内存。
  • Swift 包 – 可选的 iOS/macOS 集成,用于原生应用开发。

模型类别(摘录)

类别 示例模型 语言 / 备注
TTS Kokoro、OmniVoice、Qwen3‑TTS、Higgs Audio v3、Voxtral‑TTS 20+ 语言,支持语音克隆、速度控制
STT / ASR Whisper‑large‑v3‑turbo、Qwen3‑ASR、VibeVoice‑ASR、Moonshine 99+ 语言(Whisper),支持流式版本
VAD / Diarization Silero VAD、Sortformer v1/v2.1 语言无关,最多支持 4 位说话人
STS / Enhancement SAM‑Audio(声源分离)、DeepFilterNet、NemotronLabs VoiceChat 噪声去除、全双工语音聊天
音乐生成 MiniMax Music 3(分层 AR + 流匹配) 多语言歌词,44.1 kHz 立体声

安装方式

方法 命令 适用场景
标准 pip pip install mlx-audio 简单本地使用,包含核心库。
uv(仅 CLI 工具) uv tool install --force mlx-audio 仅需 mlx_audio.* 命令行工具时使用。
从源码安装(开发 / 服务器) ```bash
git clone https://github.com/Blaizzy/mlx-audio.git
cd mlx-audio
pip install -e ".[dev, server]"

---
## 运行 Web UI / API 服务器
```bash
# 安装时包含 "server" 附加组件后
mlx_audio.server --host 0.0.0.0 --port 8000

UI 可通过 http://localhost:8000 访问,提供文本框、语音选择器和 3D 波形可视化功能。


许可与引用

  • 许可证:MIT(参见 README 中的徽章)。
  • 引用:README 中包含 Citation 部分;发布结果时,建议引用原始模型仓库(如 Qwen3‑TTS、Whisper)。

谁会使用它?

  • 需要在 Mac 笔记本上实现低延迟语音合成或识别的语音助手或多模态代理开发者
  • 希望在 Apple 硬件上使用统一接口和便捷量化进行新音频模型原型设计的研究人员
  • 寻找 Swift 兼容音频 AI SDK 的 iOS/macOS 应用开发者
  • 希望在本地离线运行 TTS/语音克隆流水线、避免云成本的内容创作者

总结

MLX‑Audio 是一个专注于 Apple Silicon 的综合性工具箱,集成了数十个前沿语音与音乐模型,提供 CLI 和 Python API,支持激进量化,并自带 Web UI 和 OpenAI 兼容服务器。它将原本沉重的大规模音频模型世界,转变为可在 MacBook 上本地运行的轻量级解决方案。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目