soniqo/speech-swift
AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML
Speech Swift – Apple Silicon 的设备端语音 AI
是什么
- 一个 Swift 包,捆绑了大量现代语音相关模型(ASR、TTS、对齐、翻译、语音代理、增强等),可在 Mac 和 iOS 设备上本地运行。
- 使用 Apple 的 Core ML 运行时(包括神经引擎)和开源的 MLX 框架执行模型,无需任何云服务或 API 密钥。
为何重要
- 所有处理均在设备上完成,因此可保持隐私、避免延迟,并支持离线工作。
- 支持极广的语言范围(Omnilingual ASR 最多支持 1,672 种语言),涵盖从简单语音输入到全双工语音到语音代理的多种任务。
- 模型提供多种量化形式(FP16、INT8、INT5、INT4 等),可根据目标硬件在速度、内存和质量之间权衡。
核心功能
| 类别 | 示例模型(大小) | 功能 |
|---|---|---|
| 语音转文本(ASR) | Qwen3‑ASR(0.6‑1.7 B)、Whisper‑ASR(Large‑v3 Turbo)、Omnilingual(300 M‑7 B,1,672 语言) | 将音频转换为文本,支持可选的说话人分离和时间戳。 |
| 对齐 | Qwen3‑ForcedAligner(0.6 B) | 为给定转录文本生成词级时间戳。 |
| 文本转语音(TTS) | Qwen3‑TTS(0.6‑1.7 B)、CosyVoice(0.5 B)、Kokoro(82 M) | 生成自然语音,支持语音克隆和情感标签。 |
| LLM 与翻译 | Qwen3Chat(0.8‑4 B)、FunctionGemma(270 M)、MADLAD‑400(3 B) | 本地运行语言模型;支持 400+ 种语言之间的翻译。 |
| 语音转语音 / 语音代理 | PersonaPlex(7 B)、VoiceChat(11 B) | 全双工音频输入/输出代理,也可运行工具调用 LLM。 |
| 增强与分离 | DeepFilterNet3(2.1 M)、Source‑Separation(HTDemucs/UMX)、FlashSR(音频超分辨率) | 去噪、去回声、分离音乐音轨、上采样音频。 |
| 说话人切换检测与分离 | Wake‑word、VAD、Smart‑Turn、Speaker Diarisation | 检测用户何时开始/停止说话,以及谁在说话。 |
如何添加
// 在 Package.swift 中
.package(url: "https://github.com/soniqo/speech-swift", branch: "main")
然后仅导入你需要的部分,例如:
import ParakeetStreamingASR // 流式 ASR
import SpeechUI // 可选的 SwiftUI 工具
快速代码示例 – 转录音频缓冲区
import ParakeetStreamingASR
let model = try await ParakeetStreamingASRModel.fromPretrained()
let text = try model.transcribeAudio(audioSamples, sampleRate: 16_000)
print(text)
同一模型也可用于实时流式传输:
for await part in model.transcribeStream(audio: samples, sampleRate: 16_000) {
print(part.isFinal ? "FINAL: \(part.text)" : "… \(part.text)")
}
一个极小的 SwiftUI 视图(SpeechUI)可在约 10 行代码内将语音输入 UI 添加到应用中。
生态系统与社区
- 文档 – 完整指南见 https://soniqo.audio(模型特定页面、基准表格、部署技巧)。
- 预训练模型 – 在 Hugging Face 上由
aufklarer组织托管。 - 博客与 Discord – 定期发布性能技巧、新模型发布信息,以及支持用 Discord 服务器。
- Homebrew – 通过
brew install speech安装命令行工具。 - 已验证的下游项目 – 16 个公开仓库(如 AnythingLLM、Voicey、DexDictate)已依赖 Speech Swift。
典型应用场景
- 完全在设备上运行的语音助手(无网络调用)。
- 为记者、播客制作者或无障碍工具设计的转录应用。
- 播客旁白、有声书或游戏内 NPC 语音等音频生成。
- 低延迟语音到语音翻译的实时通信。
- 噪声抑制、回声消除、音源分离等音频后期处理。
性能 在 iPhone 16 Pro、Core ML 环境下的基准测试显示,流式语音输入的实时因子低至 0.04 RTF,高质量 TTS 为 0.08 RTF,意味着模型处理音频的速度快于录制速度。
许可证 大多数模型采用宽松许可证(Apache‑2.0、MIT)或非商业研究许可证发布;Swift 包本身采用 MIT 许可证开源。
总结 – Speech Swift 是一个全面、生产就绪的工具箱,将最新的语音 AI 能力带入 Apple 设备,且全程不离开设备,非常适合需要高保真语音识别、合成、翻译或语音代理功能的隐私优先型应用。
相关
- 项目
- 项目
- 项目
- 项目
- 项目