cactus-compute/cactus
Quantization, kernels, runtime and inference engine for mobiles, wearables, smart home and robots.
解决的问题
Cactus 是一个为移动设备和可穿戴设备设计的混合边缘-云 AI 引擎,旨在在资源受限的硬件上运行高性能 AI 模型。它通过提供优化的内核、高效的量化技术,以及在本地置信度较低时自动将复杂查询转发到云端的机制,解决了在资源有限的硬件上运行大型模型的挑战。
工作原理
Cactus 采用分层架构,包括引擎(Engine)、图(Graph)和内核(Kernels)。引擎提供文本、语音和视觉的 OpenAI 兼容 API。图负责零拷贝计算,内核针对特定硬件(Apple、Samsung、Pixel)进行了优化。它采用一种自定义的基于旋转的量化技术(CQ),在保持精度的同时减少模型大小和内存占用。
适用人群
需要低延迟、以离线优先的 AI 能力,并可选云回退的 AI 驱动移动和可穿戴应用的开发者。
主要亮点
- 混合边缘-云执行:基于本地模型置信度阈值,自动将复杂查询路由到云端。
- 多模态支持:集成支持文本大语言模型(LLM)、视觉语言模型(VLM)和音频转录(如 Whisper、Parakeet)。
- 自定义量化:旋转与码本量化(CQ),支持 1 位到 4 位的比特宽度。
- 广泛的硬件优化:针对多种移动芯片组优化的 ARM NEON SIMD 内核。
- 丰富的绑定支持:提供 Swift、Kotlin、Flutter、React Native、Python 和 Rust 的原生绑定。
- 集成工具链:包含 CLI 工具,支持模型转换、基准测试,以及作为 OpenAI 兼容的本地服务器运行。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目