cactus-compute/cactus

Quantization, kernels, runtime and inference engine for mobiles, wearables, smart home and robots.

What it solves

Cactus는 모바일 기기와 웨어러블을 위해 특별히 설계된 하이브리드 엣지‑클라우드 AI 엔진입니다. 텍스트, 음성, 비전 모델에 대한 고성능 로컬 추론을 가능하게 하며, 로컬 모델 신뢰도가 낮을 경우 복잡한 쿼리를 자동으로 클라우드로 전달하는 메커니즘을 제공합니다.

How it works

시스템은 레이어드 스택으로 구성됩니다:

  • Cactus Engine: 멀티모달 AI 작업을 위한 OpenAI 호환 API를 제공하고 하이브리드 클라우드 핸드오프 로직을 관리합니다.
  • Cactus Graph: 제로 카피 계산 그래프로 효율적인 텐서 연산을 수행합니다.
  • Cactus Kernels: Apple, Samsung, Pixel 디바이스와 같은 모바일 하드웨어에 최적화된 CPU/GPU 커널(ARM NEON SIMD)입니다.
  • Cactus Quants: 4비트부터 1비트까지의 가중치 텐서를 지원하는 커스텀 회전 기반 양자화 기법입니다.
  • Cactus Transpiler: Python 기반 도구로, PyTorch 모델을 Cactus 런타임 그래프 포맷으로 변환합니다.

Who it’s for

AI 기반 모바일 및 웨어러블 애플리케이션을 개발하는 개발자를 위한 것입니다. 낮은 지연 시간과 오프라인에서도 가능한 추론이 필요하고, 높은 정확도를 위해 클라우드 폴백 옵션을 원하는 경우에 적합합니다.

Highlights

  • Hybrid Execution: 로컬 모델 신뢰도 임계값에 따라 어려운 쿼리를 자동으로 클라우드로 라우팅합니다.
  • Multimodal Support: 로컬에서 LLM, VLM(비전 언어 모델) 및 전사 모델(예: Whisper, Parakeet)을 실행합니다.
  • Broad Hardware Optimization: 다양한 Android 및 iOS 디바이스의 모바일 CPU와 GPU를 위한 특화된 커널을 제공합니다.
  • Extreme Quantization: 4비트부터 1비트까지 혼합 정밀도 및 균일 양자화를 지원합니다.
  • Cross-Platform Bindings: Swift, Kotlin, Flutter, React Native, Python, Rust용 공식 바인딩을 제공합니다.