argmaxinc/argmax-oss-swift

On-device Speech AI for Apple Silicon

해결하는 문제

Argmax Open-Source SDK는 Apple 플랫폼(macOS 및 iOS)에서 AI 오디오 모델을 완전히 온디바이스로 실행할 수 있는 일련의 턴키 프레임워크를 제공합니다. 이를 통해 음성 인식, 음성 합성 및 화자 식별을 위한 클라우드 기반 API의 필요성을 제거하여 개인정보를 보호하고 지연 시간을 줄입니다.

작동 방식

SDK는 Core ML를 기반으로 구축되었으며 세 가지 전문 "키트"로 구성됩니다:

  • WhisperKit: 음성 인식 및 번역을 위해 OpenAI의 Whisper를 구현합니다. 기존 클라이언트와의 쉬운 통합을 위해 OpenAI Audio API를 모방한 로컬 서버가 포함되어 있습니다.
  • TTSKit: Qwen3-TTS 모델을 사용하여 다국어 지원, 사용자 정의 음성 및 실시간 스트리밍 재생이 가능한 텍스트 음성 변환을 수행합니다.
  • SpeakerKit: Pyannote를 활용한 화자 분리를 통해 오디오 녹음에서 "누가 언제 말했는지"를 시스템이 식별할 수 있도록 합니다.

대상 사용자

외부 서버에 의존하지 않고 문자 변환, 음성 합성, 화자 식별과 같은 고성능 오디오 AI 기능을 앱에 직접 통합하고자 하는 macOS 및 iOS 개발자.

주요 특징

  • 온디바이스 추론: 모든 처리는 Core ML를 통해 Apple silicon에서 로컬로 수행됩니다.
  • OpenAI API 호환성: 표준 OpenAI SDK 클라이언트를 사용하여 로컬 문자 변환을 수행할 수 있는 로컬 서버가 포함되어 있습니다.
  • 스트리밍 기능: TTS를 위한 실시간 스트리밍 재생과 WhisperKit의 대용량 오디오 파일 메모리 관리를 위한 증분 로딩을 지원합니다.
  • 다국어 지원: TTSKit은 10개 언어와 여러 내장 음성을 지원하며, WhisperKit은 정확도/속도 트레이드오프에 따라 다양한 모델 크기를 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트