soniqo/speech-swift

AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML

Speech Swift – Apple Silicon 的设备端语音 AI

是什么

  • 一个 Swift 包,捆绑了大量现代语音相关模型(ASR、TTS、对齐、翻译、语音代理、增强等),可在 Mac 和 iOS 设备上本地运行。
  • 使用 Apple 的 Core ML 运行时(包括神经引擎)和开源的 MLX 框架执行模型,无需任何云服务或 API 密钥。

为何重要

  • 所有处理均在设备上完成,因此可保持隐私、避免延迟,并支持离线工作。
  • 支持极广的语言范围(Omnilingual ASR 最多支持 1,672 种语言),涵盖从简单语音输入到全双工语音到语音代理的多种任务。
  • 模型提供多种量化形式(FP16、INT8、INT5、INT4 等),可根据目标硬件在速度、内存和质量之间权衡。

核心功能

类别 示例模型(大小) 功能
语音转文本(ASR) Qwen3‑ASR(0.6‑1.7 B)、Whisper‑ASR(Large‑v3 Turbo)、Omnilingual(300 M‑7 B,1,672 语言) 将音频转换为文本,支持可选的说话人分离和时间戳。
对齐 Qwen3‑ForcedAligner(0.6 B) 为给定转录文本生成词级时间戳。
文本转语音(TTS) Qwen3‑TTS(0.6‑1.7 B)、CosyVoice(0.5 B)、Kokoro(82 M) 生成自然语音,支持语音克隆和情感标签。
LLM 与翻译 Qwen3Chat(0.8‑4 B)、FunctionGemma(270 M)、MADLAD‑400(3 B) 本地运行语言模型;支持 400+ 种语言之间的翻译。
语音转语音 / 语音代理 PersonaPlex(7 B)、VoiceChat(11 B) 全双工音频输入/输出代理,也可运行工具调用 LLM。
增强与分离 DeepFilterNet3(2.1 M)、Source‑Separation(HTDemucs/UMX)、FlashSR(音频超分辨率) 去噪、去回声、分离音乐音轨、上采样音频。
说话人切换检测与分离 Wake‑word、VAD、Smart‑Turn、Speaker Diarisation 检测用户何时开始/停止说话,以及谁在说话。

如何添加

// 在 Package.swift 中
.package(url: "https://github.com/soniqo/speech-swift", branch: "main")

然后仅导入你需要的部分,例如:

import ParakeetStreamingASR   // 流式 ASR
import SpeechUI               // 可选的 SwiftUI 工具

快速代码示例 – 转录音频缓冲区

import ParakeetStreamingASR

let model = try await ParakeetStreamingASRModel.fromPretrained()
let text  = try model.transcribeAudio(audioSamples, sampleRate: 16_000)
print(text)

同一模型也可用于实时流式传输:

for await part in model.transcribeStream(audio: samples, sampleRate: 16_000) {
    print(part.isFinal ? "FINAL: \(part.text)" : "… \(part.text)")
}

一个极小的 SwiftUI 视图(SpeechUI)可在约 10 行代码内将语音输入 UI 添加到应用中。

生态系统与社区

  • 文档 – 完整指南见 https://soniqo.audio(模型特定页面、基准表格、部署技巧)。
  • 预训练模型 – 在 Hugging Face 上由 aufklarer 组织托管。
  • 博客与 Discord – 定期发布性能技巧、新模型发布信息,以及支持用 Discord 服务器。
  • Homebrew – 通过 brew install speech 安装命令行工具。
  • 已验证的下游项目 – 16 个公开仓库(如 AnythingLLM、Voicey、DexDictate)已依赖 Speech Swift。

典型应用场景

  • 完全在设备上运行的语音助手(无网络调用)。
  • 为记者、播客制作者或无障碍工具设计的转录应用。
  • 播客旁白、有声书或游戏内 NPC 语音等音频生成。
  • 低延迟语音到语音翻译的实时通信。
  • 噪声抑制、回声消除、音源分离等音频后期处理。

性能 在 iPhone 16 Pro、Core ML 环境下的基准测试显示,流式语音输入的实时因子低至 0.04 RTF,高质量 TTS 为 0.08 RTF,意味着模型处理音频的速度快于录制速度。

许可证 大多数模型采用宽松许可证(Apache‑2.0、MIT)或非商业研究许可证发布;Swift 包本身采用 MIT 许可证开源。


总结 – Speech Swift 是一个全面、生产就绪的工具箱,将最新的语音 AI 能力带入 Apple 设备,且全程不离开设备,非常适合需要高保真语音识别、合成、翻译或语音代理功能的隐私优先型应用。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目