cactus-compute/needle
14MB foundation model for tiny devices; phones, wearables, smart home, and robots.
何を解決するか
Needle 2 は、ツール呼び出し、デバイス制御、構造化データ抽出を目的とした、非常にコンパクトな 45M パラメータモデルです。小さなデバイス上で動作するための AI エージェントの需要に応え、約 28MB の RAM という最小限のメモリ使用量で、通常ははるかに大きなモデルが必要とされる複雑なツール使用タスクを実行できるようにします。
動作方法
このプロジェクトは「シンプルなアテンションネットワーク」アーキテクチャを使用しており、ハダマール MLP、GQA アテンション、エングラムキーバリューメモリを特徴としています。極めて小さなサイズを実現するために、モデルは 2 ビット量子化(CQ2-bit)に圧縮され、14MB の単一バイナリエンジンに埋め込まれています。デコードを制約するためにバイトレベルの文法を使用しており、提供されたスキーマに基づいて有効な JSON としてツール呼び出しが返されるようにしています。また、各ターンごとに上位 5 つのツールのみを選択するための組み込みリトリーバヘッドも備えています。
対象ユーザー
メモリと電力が限られた環境で AI エージェントを開発する開発者向けです。ウェアラブルデバイス、スマートホームデバイス、その他の組み込みシステムに適しています。
特徴
- 極めて効率的: 14MB のバイナリが約 28MB の RAM で実行可能で、5〜70倍も大きなモデルと競合します。
- 信頼度ゲート: すべての応答に校正された信頼度スコアが含まれており、しきい値に基づくエスカレーションが可能になります。
- 構造化出力: コンパイルされたバイトレベルの文法を使用して、ツールスキーマに基づいた JSON 出力を保証します。
- 統合パイプライン: 合成データ生成、JAX を用いた LoRA ファインチューニング、コンパクトな
.cact形式へのエクスポートを含むツールが備わっています。 - 事前構築済み環境: スマートホーム、メディアプレーヤー、ウェアラブルデバイスなどの分野向けの準備済みツール表面が提供されています。
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- プロジェクト