argmaxinc/argmax-oss-swift
On-device Speech AI for Apple Silicon
What it solves
Argmax Open-Source SDK는 Apple 플랫폼(macOS 및 iOS)에서 AI 오디오 모델을 완전히 온‑디바이스로 실행할 수 있는 턴키 프레임워크 세트를 제공합니다. 전사, 음성 합성, 화자 식별과 같은 일반적인 오디오 작업에 클라우드 기반 API가 필요 없어 지연 시간이 낮아지고 프라이버시가 향상됩니다.
How it works
SDK는 Core ML 위에 구축된 세 가지 특화된 "킷"의 컬렉션으로, Apple Silicon에서 최적화된 모델을 실행합니다:
- WhisperKit: OpenAI의 Whisper를 구현하여 음성‑텍스트 전사 및 번역을 수행합니다.
- TTSKit: Qwen‑TTS 모델을 사용해 텍스트‑음성 생성을 제공하며, 실시간 스트리밍 재생 및 자연어 스타일 지시를 지원합니다.
- SpeakerKit: Pyannote를 활용해 화자 다이어리제이션(누가 언제 말했는지 식별)을 수행합니다.
Swift CLI가 포함되어 테스트에 사용할 수 있으며, OpenAI Audio API를 모방하는 로컬 서버가 제공되어 기존 OpenAI 호환 클라이언트를 사용해 온‑디바이스 기능을 쉽게 통합할 수 있습니다.
Who it’s for
iOS 및 macOS용 앱을 개발하는 Apple 개발자이며, 외부 서버에 의존하지 않고 고품질 음성‑텍스트, 텍스트‑음성 또는 화자 다이어리제이션을 통합하고자 하는 분들을 위한 것입니다.
Highlights
- On-Device Inference: Core ML을 통해 Apple Silicon에서 완전 실행됩니다.
- OpenAI API Compatibility: OpenAI Audio API를 구현한 로컬 서버가 포함되어 있어 통합이 용이합니다.
- Real-Time Streaming: TTSKit은 생성되는 오디오를 프레임 단위로 재생합니다.
- Multilingual Support: 전사와 음성 합성 모두에서 다양한 언어를 지원합니다.
- Flexible Model Selection: 속도와 정확성의 균형을 맞추기 위해 Tiny부터 Large까지 다양한 모델 크기를 제공합니다.