cactus-compute/cactus

Quantization, kernels, runtime and inference engine for mobiles, wearables, smart home and robots.

What it solves

Cactus 是一个专为移动设备和可穿戴设备设计的混合边缘‑云 AI 引擎。它能够在本地高性能执行文本、语音和视觉模型,同时在本地模型置信度不足时,提供自动将复杂查询交给云端处理的机制。

How it works

系统以分层堆栈方式构建:

  • Cactus Engine:提供兼容 OpenAI 的多模态 AI 任务 API,并管理混合云交接逻辑。
  • Cactus Graph:零拷贝计算图,用于高效张量运算。
  • Cactus Kernels:针对移动硬件(如 Apple、Samsung、Pixel 设备)优化的 CPU/GPU 核心(ARM NEON SIMD)。
  • Cactus Quants:自定义的基于旋转的量化技术,支持从 4 位到 1 位的权重张量。
  • Cactus Transpiler:以 Python 编写的工具,将 PyTorch 模型转换为 Cactus 运行时图形格式。

Who it’s for

开发 AI 驱动的移动和可穿戴应用的开发者,需要低延迟、离线可用的推理,同时保有云端回退以提升准确度。

Highlights

  • Hybrid Execution:根据本地模型置信度阈值,自动将困难查询路由至云端。
  • Multimodal Support:本地执行 LLM、VLM(视觉语言模型)以及转录模型(如 Whisper、Parakeet)。
  • Broad Hardware Optimization:针对各种 Android 与 iOS 设备的移动 CPU 与 GPU 提供专属核心。
  • Extreme Quantization:支持混合精度与统一量化,范围从 4 位到 1 位。
  • Cross-Platform Bindings:提供官方绑定支持 Swift、Kotlin、Flutter、React Native、Python 与 Rust。