argmaxinc/argmax-oss-swift

On-device Speech AI for Apple Silicon

What it solves

Argmax Open-Source SDK 为 Apple 平台(macOS 和 iOS)提供了一套可直接在设备上运行 AI 音频模型的即插即用框架。它消除了对云端 API 的需求,适用于转录、语音合成和说话人识别等常见音频任务,从而实现更低的延迟和更好的隐私保护。

How it works

SDK 是基于 Core ML 构建的三个专用 “Kit” 的集合,可在 Apple Silicon 上运行优化后的模型:

  • WhisperKit:实现 OpenAI 的 Whisper,用于语音转文本的转录和翻译。
  • TTSKit:使用 Qwen‑TTS 模型进行文本转语音生成,支持实时流式播放和自然语言风格指令。
  • SpeakerKit:利用 Pyannote 进行说话人分割(识别谁在何时说话)。

SDK 包含一个 Swift CLI 用于测试,还提供一个本地服务器,模拟 OpenAI Audio API,开发者可以使用现有的兼容 OpenAI 的客户端轻松集成这些设备端能力。

Who it’s for

面向在 iOS 和 macOS 上开发应用的 Apple 开发者,想要在不依赖外部服务器的情况下集成高质量的语音转文本、文本转语音或说话人分割功能。

Highlights

  • On-Device Inference:通过 Core ML 完全在 Apple Silicon 上运行。
  • OpenAI API Compatibility:内置实现 OpenAI Audio API 的本地服务器,便于集成。
  • Real-Time Streaming:TTSKit 支持边生成边进行帧级音频播放。
  • Multilingual Support:支持多语言的转录和语音合成。
  • Flexible Model Selection:提供从 Tiny 到 Large 的多种模型尺寸,以平衡速度和准确度。