cactus-compute/cactus
Quantization, kernels, runtime and inference engine for mobiles, wearables, smart home and robots.
何を解決するか
Cactus は、モバイルデバイスおよびウェアラブルデバイス上で高性能なAIモデルを実行するためのハイブリッドエッジクラウドAIエンジンです。リソースが限られたハードウェア上で大規模なモデルを実行する課題に対処するために、最適化されたカーネル、効率的な量子化、およびローカルの信頼度が低い場合に自動的に難易度の高いクエリをクラウドに転送するメカニズムを提供します。
動作方法
Cactus は、エンジン、グラフ、カーネルからなるレイヤードアーキテクチャを使用しています。エンジンはテキスト、音声、ビジョン用のOpenAI互換APIを提供します。グラフはゼロコピー計算を処理し、カーネルは特定のハードウェア(Apple、Samsung、Pixel)に最適化されています。モデルサイズとメモリ使用量を削減しつつ精度を維持するために、独自の回転ベース量子化技術(CQ)を採用しています。
対象ユーザー
低遅延、オフライン優先のAI機能を必要とする、AI搭載のモバイルおよびウェアラブルアプリケーションを開発する開発者。クラウドフォールバック機能もオプションで利用可能。
主な特徴
- ハイブリッドエッジクラウド実行: ローカルモデルの信頼度閾値に基づき、難易度の高いクエリを自動的にクラウドにルーティング。
- マルチモーダル対応: テキストLLM、ビジョン言語モデル(VLM)、音声トランスクリプション(例:Whisper、Parakeet)を統合サポート。
- カスタム量子化: 回転とコードブック量子化(CQ)を採用し、1ビットから4ビットまでのビット幅をサポート。
- 広範なハードウェア最適化: さまざまなモバイルチップセット向けに最適化されたARM NEON SIMDカーネル。
- 豊富なバインディング: Swift、Kotlin、Flutter、React Native、Python、Rust向けのネイティブバインディングを提供。
- 統合ツールキット: モデル変換、ベンチマーク、OpenAI互換のローカルサーバーとしての提供を可能にするCLIを含む。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト