Blaizzy/mlx-audio

A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.

解决的问题

MLX-Audio 提供专门针对 Apple Silicon(M 系列芯片)优化的高性能音频处理库。它简化了用于文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 任务的复杂音频 AI 模型的部署,使用户能够高效地在本地运行这些模型。

工作原理

该库基于 Apple 的 MLX 框架构建,集成了社区提供的多种预训练模型。它支持多种模态,包括:

  • Text-to-Speech (TTS): 从文本生成自然语音,支持语音克隆、多语言输出和情感控制。
  • Speech-to-Text (STT): 将音频转录为文本,包括词级对齐、说话人日志(识别说话者)和流式转录。
  • Speech-to-Speech (STS): 处理源分离、语音增强和噪声抑制等任务。
  • VAD/Diarization: 检测语音活动并分离不同的说话人。

适用对象

  • 为 macOS 和 iOS 构建以音频为核心的应用程序的开发者
  • 希望在 Apple 硬件上运行最先进音频模型的研究人员
  • 需要快速、本地且私密的音频处理,而不依赖云端 API 的用户

亮点

  • Apple Silicon 优化: 为 M 系列芯片量身定制的快速推理。
  • 兼容 API: 包括与 OpenAI 兼容的 REST API 和带有 3D 音频可视化的 Web 界面。
  • 广泛的模型支持: 集成了 Whisper、Kokoro、Qwen3-TTS 和 VibeVoice-ASR 等数十种模型。
  • C 级集成: 提供用于原生 iOS/macOS 集成的 Swift 软件包。
  • 性能调优: 支持量化(3-bit 到 8-bit),以减少内存占用并提高速度。