argmaxinc/argmax-oss-swift
On-device Speech AI for Apple Silicon
解决的问题
Argmax Open-Source SDK 提供了一套开箱即用的框架,可在 Apple 平台(macOS 和 iOS)上完全在设备端运行 AI 音频模型。它消除了对语音转文字、文字转语音和说话人识别云端 API 的需求,确保了隐私并降低了延迟。
工作原理
该 SDK 基于 Core ML 构建,由三个专门的“套件”组成:
- WhisperKit:实现 OpenAI 的 Whisper 用于语音转文字转录和翻译。它包含一个模拟 OpenAI Audio API 的本地服务器,以便与现有客户端轻松集成。
- TTSKit:使用 Qwen3-TTS 模型将文本转换为语音,支持多种语言、自定义声音和实时流式播放。
- SpeakerKit:利用 Pyannote 进行说话人日志,允许系统识别音频录制中“谁在何时说话”。
适用对象
正在为 macOS 和 iOS 进行开发,并希望将高性能音频 AI 能力(如转录、语音合成和说话人识别)直接集成到应用中,而不依赖外部服务器的开发者。
亮点
- 端侧推理:所有处理均通过 Core ML 在 Apple silicon 上本地完成。
- OpenAI API 兼容性:包含一个本地服务器,允许开发者使用标准的 OpenAI SDK 客户端进行本地转录。
- 流式传输能力:支持 TTS 的实时流式播放,以及 WhisperKit 中用于管理内存的大型音频文件的增量加载。
- 多语言支持:TTSKit 支持 10 种语言和多种内置声音;WhisperKit 支持用于不同精度/速度权衡的各种模型大小。
相关
- 项目
- 项目
- 项目
- 项目
- 项目