cactus-compute/cactus

Quantization, kernels, runtime and inference engine for mobiles, wearables, smart home and robots.

해결하는 문제

Cactus는 모바일 기기와 웨어러블 장치에서 고성능 AI 모델을 실행하기 위해 설계된 하이브리드 에지-클라우드 AI 엔진입니다. 제한된 리소스를 가진 하드웨어에서 대규모 모델을 실행하는 과제를 해결하기 위해 최적화된 커널, 효율적인 양자화, 그리고 로컬 신뢰도가 낮을 경우 어려운 쿼리를 자동으로 클라우드로 전달하는 메커니즘을 제공합니다.

작동 방식

Cactus는 엔진, 그래프, 커널로 구성된 계층적 아키텍처를 사용합니다. 엔진은 텍스트, 음성, 비전용 OpenAI 호환 API를 제공합니다. 그래프는 제로-코피 계산을 처리하며, 커널은 특정 하드웨어(Apple, Samsung, Pixel)에 최적화되어 있습니다. 모델 크기와 메모리 사용량을 줄이면서 정확도를 유지하기 위해 고유한 회전 기반 양자화 기술(CQ)을 사용합니다.

대상 사용자

저지연, 오프라인 우선 AI 기능이 필요한 AI 기반 모바일 및 웨어러블 애플리케이션을 개발하는 개발자. 클라우드 백업 기능은 선택 사항입니다.

주요 특징

  • 하이브리드 에지-클라우드 실행: 로컬 모델 신뢰도 임계값에 따라 어려운 쿼리를 자동으로 클라우드로 라우팅.
  • 다중 모달 지원: 텍스트 LLM, 비전 언어 모델(VLM), 오디오 전사(예: Whisper, Parakeet)를 통합 지원.
  • 사용자 정의 양자화: 회전 및 코드북 양자화(CQ)로 1비트에서 4비트까지의 비트 폭을 지원.
  • 광범위한 하드웨어 최적화: 다양한 모바일 칩셋을 위한 최적화된 ARM NEON SIMD 커널.
  • 풍부한 바인딩: Swift, Kotlin, Flutter, React Native, Python, Rust용 네이티브 바인딩 제공.
  • 통합 도구: 모델 변환, 벤치마킹, OpenAI 호환 로컬 서버로 실행하는 CLI 포함.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트