cactus-compute/needle

14MB foundation model for tiny devices; phones, wearables, smart home, and robots.

何を解決するか

Needle 2 は、ツール呼び出し、デバイス制御、構造化データ抽出を目的とした、非常にコンパクトな 45M パラメータモデルです。小さなデバイス上で動作するための AI エージェントの需要に応え、約 28MB の RAM という最小限のメモリ使用量で、通常ははるかに大きなモデルが必要とされる複雑なツール使用タスクを実行できるようにします。

動作方法

このプロジェクトは「シンプルなアテンションネットワーク」アーキテクチャを使用しており、ハダマール MLP、GQA アテンション、エングラムキーバリューメモリを特徴としています。極めて小さなサイズを実現するために、モデルは 2 ビット量子化(CQ2-bit)に圧縮され、14MB の単一バイナリエンジンに埋め込まれています。デコードを制約するためにバイトレベルの文法を使用しており、提供されたスキーマに基づいて有効な JSON としてツール呼び出しが返されるようにしています。また、各ターンごとに上位 5 つのツールのみを選択するための組み込みリトリーバヘッドも備えています。

対象ユーザー

メモリと電力が限られた環境で AI エージェントを開発する開発者向けです。ウェアラブルデバイス、スマートホームデバイス、その他の組み込みシステムに適しています。

特徴

  • 極めて効率的: 14MB のバイナリが約 28MB の RAM で実行可能で、5〜70倍も大きなモデルと競合します。
  • 信頼度ゲート: すべての応答に校正された信頼度スコアが含まれており、しきい値に基づくエスカレーションが可能になります。
  • 構造化出力: コンパイルされたバイトレベルの文法を使用して、ツールスキーマに基づいた JSON 出力を保証します。
  • 統合パイプライン: 合成データ生成、JAX を用いた LoRA ファインチューニング、コンパクトな .cact 形式へのエクスポートを含むツールが備わっています。
  • 事前構築済み環境: スマートホーム、メディアプレーヤー、ウェアラブルデバイスなどの分野向けの準備済みツール表面が提供されています。

関連