argmaxinc/argmax-oss-swift
On-device Speech AI for Apple Silicon
What it solves
Argmax Open-Source SDK 为 Apple 平台(macOS 和 iOS)提供了一套可直接在设备上运行 AI 音频模型的即插即用框架。它消除了对云端 API 的需求,适用于转录、语音合成和说话人识别等常见音频任务,从而实现更低的延迟和更好的隐私保护。
How it works
SDK 是基于 Core ML 构建的三个专用 “Kit” 的集合,可在 Apple Silicon 上运行优化后的模型:
- WhisperKit:实现 OpenAI 的 Whisper,用于语音转文本的转录和翻译。
- TTSKit:使用 Qwen‑TTS 模型进行文本转语音生成,支持实时流式播放和自然语言风格指令。
- SpeakerKit:利用 Pyannote 进行说话人分割(识别谁在何时说话)。
SDK 包含一个 Swift CLI 用于测试,还提供一个本地服务器,模拟 OpenAI Audio API,开发者可以使用现有的兼容 OpenAI 的客户端轻松集成这些设备端能力。
Who it’s for
面向在 iOS 和 macOS 上开发应用的 Apple 开发者,想要在不依赖外部服务器的情况下集成高质量的语音转文本、文本转语音或说话人分割功能。
Highlights
- On-Device Inference:通过 Core ML 完全在 Apple Silicon 上运行。
- OpenAI API Compatibility:内置实现 OpenAI Audio API 的本地服务器,便于集成。
- Real-Time Streaming:TTSKit 支持边生成边进行帧级音频播放。
- Multilingual Support:支持多语言的转录和语音合成。
- Flexible Model Selection:提供从 Tiny 到 Large 的多种模型尺寸,以平衡速度和准确度。