soniqo/speech-swift
AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML
解决的问题
Speech Swift 能够在 Mac 和 iOS 设备上实现高性能的本地 AI 语音处理。它无需云端处理或 API 密钥,在确保音频数据绝不离开用户设备的同时,为实时应用提供低延迟能力。
工作原理
该库基于 MLX Swift 和 CoreML 构建,允许开发者直接在 Apple Silicon(包括神经网络引擎 Neural Engine)上运行各种专用模型。它是模块化的,允许开发者仅导入所需的特定 SPM (Swift Package Manager) 产品,例如特定的 ASR、TTS 或 LLM 模块。
适用对象
- 构建注重隐私的语音代理或转录工具的 iOS 和 macOS 开发者
- 寻求高性能、设备端语音转文本 (STT)、文本转语音 (TTS) 和语音转语音能力的 AI 工程师
- 需要无需依赖云端的实时听写、声音克隆或音频增强功能的 应用创作者
亮点
- 全面的语音套件:支持自动语音识别 (ASR)、文本转语音 (TTS)、语音对语音翻译和音频增强。
- 设备端隐私:所有处理均在本地完成,确保数据安全和离线功能。
- 广泛的模型支持:包括 Whisper、Qwen、Kokoro 等多种实现,覆盖数百种语言。
- 模块化架构:通过 Swift Package Manager 集成,允许仅导入必要的模块来实现轻量化构建。
- 高性能:针对 Apple Silicon 进行了优化,利用神经网络引擎实现低延迟流式传输和高实时率 (RTF) 效率。