cactus-compute/cactus
Quantization, kernels, runtime and inference engine for mobiles, wearables, smart home and robots.
What it solves
Cactus 是一个专为移动设备和可穿戴设备设计的混合边缘‑云 AI 引擎。它能够在本地高性能执行文本、语音和视觉模型,同时在本地模型置信度不足时,提供自动将复杂查询交给云端处理的机制。
How it works
系统以分层堆栈方式构建:
- Cactus Engine:提供兼容 OpenAI 的多模态 AI 任务 API,并管理混合云交接逻辑。
- Cactus Graph:零拷贝计算图,用于高效张量运算。
- Cactus Kernels:针对移动硬件(如 Apple、Samsung、Pixel 设备)优化的 CPU/GPU 核心(ARM NEON SIMD)。
- Cactus Quants:自定义的基于旋转的量化技术,支持从 4 位到 1 位的权重张量。
- Cactus Transpiler:以 Python 编写的工具,将 PyTorch 模型转换为 Cactus 运行时图形格式。
Who it’s for
开发 AI 驱动的移动和可穿戴应用的开发者,需要低延迟、离线可用的推理,同时保有云端回退以提升准确度。
Highlights
- Hybrid Execution:根据本地模型置信度阈值,自动将困难查询路由至云端。
- Multimodal Support:本地执行 LLM、VLM(视觉语言模型)以及转录模型(如 Whisper、Parakeet)。
- Broad Hardware Optimization:针对各种 Android 与 iOS 设备的移动 CPU 与 GPU 提供专属核心。
- Extreme Quantization:支持混合精度与统一量化,范围从 4 位到 1 位。
- Cross-Platform Bindings:提供官方绑定支持 Swift、Kotlin、Flutter、React Native、Python 与 Rust。