Desert Ant Labs: 온디바이스 특화 AI 모델

Desert Ant Labs는 비용이 많이 드는 클라우드 API 호출을 로컬 추론으로 대체하기 위해 설계된 18개의 특화된 온디바이스 AI 모델 컬렉션을 출시했습니다. 범용 LLM 대신 작고 작업 특화적인 모델에 집중함으로써, 이 연구소는 토큰 가격, 네트워크 지연 시간 또는 데이터 개인정보 보호 문제에 대한 제약 없이 "모든 제품 상호작용을 위한 온디바이스 지능"을 구현하는 것을 목표로 합니다.

고성능 특화 모델

Desert Ant Labs는 Swift, Kotlin, JavaScript용 단일 SDK를 통해 접근 가능한 12개의 안정적인 모델과 6개의 베타 모델을 제공합니다. 이 모델들은 Apple의 Neural Engine과 같은 온디바이스 가속기를 활용하여 5년 된 스마트폰과 같은 오래된 하드웨어에서도 실행되도록 설계되었습니다.

주요 모델은 다음과 같습니다:

  • Voz: iPhone에서 10분 분량의 오디오를 2초 만에 전사할 수 있는 오디오 전사 모델로, Whisper보다 4.7배 빠른 성능을 주장합니다.
  • Clear: 5분 분량의 클립을 약 1초 만에 스튜디오 품질로 변환하는 9MB 오디오 향상 모델입니다.
  • Redact: 27개 언어에 대해 실시간으로 작동하는 12MB PII (개인 식별 정보) 마스킹 모델입니다.
  • Tongue: 단 3개의 단어만으로 84개 언어를 식별할 수 있는 2MB 언어 식별 모델입니다.
  • Clips: 10분 분량의 비디오를 5초 만에 짧은 클립으로 변환하는 284MB 모델로, 연구소는 동일한 작업에 대해 Claude Sonnet보다 10배 빠르고 에너지를 470배 적게 사용한다고 주장합니다.

아키텍처: "Cerebellum" 방식

Desert Ant Labs는 현재의 AI 환경이 범용 "프런티어 브레인"에 과도하게 의존하고 있다고 봅니다. 그들의 아키텍처 철학은 지능을 두 개의 레이어로 나눕니다:

  1. The Cerebellum (작은 뇌): 항상 켜져 있는 반복적인 작업(예: 타이밍, 균형, 기본 태깅)을 처리하는 빠르고 특화된 모델입니다. 이들은 로컬에서 무료로 실행됩니다.
  2. The Cortex (결정 레이어): 어떤 모델을 사용할지 결정하는 레이어입니다. 작업을 먼저 로컬 소형 모델로, 두 번째로 더 큰 로컬 모델로 라우팅하고, 클라우드는 최후의 수단으로만 사용합니다.

이 접근 방식은 이미 출고된 수십억 개의 모바일 기기와 노트북의 기존 컴퓨팅 파워를 활용하며, 데이터 센터 인프라에 대한 연간 4,500억 달러의 지출을 피하기 위해 기기의 NPU/GPU를 "이미 지불된" 리소스로 취급합니다.

개발자 구현 및 접근성

모델은 Swift, Kotlin, JavaScript용 네이티브 SDK를 통해 배포되며, Mac 사용자를 위한 CLI도 제공됩니다. 연구소는 월간 활성 기기(MAD) 100,000대까지 모델을 무료로 제공하며, 로그인이나 토큰이 필요하지 않습니다.

기술적 구현

  • Apple Ecosystem: 모델은 Neural Engine에서 실행되도록 Core ML을 활용합니다.
  • Web: 가중치는 브라우저 기반 애플리케이션을 위해 WebAssembly (Wasm)를 통해 실행됩니다.
  • Cross-Platform: 주요 모바일 및 웹 개발 언어용 SDK가 제공됩니다.

커뮤니티 인사이트 및 기술적 비판

발표 이후, Hacker News의 개발자 커뮤니티는 이 모델들의 기원과 접근성에 대해 몇 가지 비판적인 관점을 제공했습니다:

모델 출처

일부 사용자들은 Desert Ant 모델이 기존 오픈 소스 프로젝트의 래퍼(wrapper)일 수 있다고 제사했습니다. 구체적으로, 한 사용자는 다음과 같이 주장했습니다:

"Voz is Parakeet 0.6B v3 Clear is DeepFilterNet 3 Ear is the language predictor from whisper-tiny..."

플랫폼 제한

개발자들은 생태계의 상당한 격차를, 특히 AI 실험의 업계 표준인 Python SDK의 부재를 지적했습니다. 또한, 일부 사용자들은 제공된 벤치마크가 최신 Apple 하드웨어(예: iPhone 16 Pro, M3 Ultra)에 편중되어 있어, 저사양 Android 기기나 일반적인 VPS 환경에서의 성능을 제한할 수 있다고 우려했습니다.

수익화 및 지속 가능성

모델이 로컬에서 실행되고 클라우드 컴퓨팅을 필요로 하지 않는다는 점을 고려할 때, 일부 커뮤니티 멤버들은 장기적인 비즈니스 모델에 대해 의문을 제기했습니다. 만약 개발자가 가중치를 다운로드하여 오프라인에서 실행한다면, 전통적인 API 기반 LLM 과금 방식과 비교하여 정기적인 결제나 구독에 대한 유인이 명만합니다.

정확도 문제

초기 테스터들은 특정 작업에서 일부 부정확함을 보고했습니다. 예를 들어, Tongue 모델이 일본어 텍스트("馬鹿外人")를 중국어로 오인식하는 경우가 있었습니다.

Sources

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • Dispatch