cactus-compute/cactus
Quantization, kernels, runtime and inference engine for mobiles, wearables, smart home and robots.
What it solves
Cactus はモバイルデバイスとウェアラブル向けに特化したハイブリッドエッジ‑クラウド AI エンジンです。テキスト、音声、ビジョンモデルのローカルでの高性能推論を可能にし、ローカルモデルの信頼度が低い場合に複雑なクエリを自動的にクラウドへ委譲する仕組みを提供します。
How it works
システムはレイヤードスタックとして構築されています:
- Cactus Engine:マルチモーダル AI タスク向けの OpenAI 互換 API を提供し、ハイブリッドクラウドハンドオフロジックを管理します。
- Cactus Graph:ゼロコピー計算グラフで、効率的なテンソル演算を実現します。
- Cactus Kernels:Apple、Samsung、Pixel デバイスなどのモバイルハードウェア向けに最適化された CPU/GPU カーネル(ARM NEON SIMD)です。
- Cactus Quants:重みテンソルを 4 ビットから 1 ビットまでサポートする、カスタムの回転ベース量子化手法です。
- Cactus Transpiler:Python ベースのツールで、PyTorch モデルを Cactus ランタイムグラフ形式に変換します。
Who it’s for
AI 搭載のモバイル・ウェアラブルアプリを開発する開発者向けです。低レイテンシでオフラインでも動作する推論が必要で、精度向上のためにクラウドフォールバックを利用したい方に最適です。
Highlights
- Hybrid Execution:ローカルモデルの信頼度閾値に基づき、難しいクエリを自動的にクラウドへルーティングします。
- Multimodal Support:ローカルで LLM、VLM(Vision Language Model)、および文字起こしモデル(例:Whisper、Parakeet)を実行可能です。
- Broad Hardware Optimization:さまざまな Android と iOS デバイスのモバイル CPU と GPU 向けに特化したカーネルを提供します。
- Extreme Quantization:4 ビットから 1 ビットまでの混合精度・統一量子化をサポートします。
- Cross-Platform Bindings:Swift、Kotlin、Flutter、React Native、Python、Rust 用の公式バインディングを提供します。