cactus-compute/needle
14MB foundation model for tiny devices; phones, wearables, smart home, and robots.
解决的问题
Needle 2 是一个高度紧凑的 45M 参数模型,专为在小型设备上进行工具调用、设备控制和结构化数据提取而设计。它解决了对本地运行、内存占用极小(约 28MB RAM)的 AI 代理的需求,同时不牺牲执行通常需要更大模型才能完成的复杂工具使用任务的能力。
工作原理
该项目采用“简单注意力网络”架构,包含哈达玛 MLP、GQA 注意力机制和记忆体键值对(engram key-value memory)。为实现其极致的小型化,模型被压缩至 2 位量化(CQ2-bit),并固化为一个 14MB 的单一二进制引擎。它使用字节级语法来约束解码过程,确保工具调用结果基于提供的模式返回有效的 JSON。此外,还内置了检索头,可每轮仅选择前五个工具,以管理大型工具目录。
适用人群
适用于在资源受限环境中开发 AI 代理的开发者,例如可穿戴设备、智能家居设备以及其他嵌入式系统,这些场景对内存和功耗有严格限制。
主要亮点
- 极致高效:14MB 的二进制文件可在约 28MB 的 RAM 中运行,性能可与 5 到 70 倍更大的模型相媲美。
- 置信度门控:每个响应都包含经过校准的置信度分数,支持基于阈值的升级机制。
- 结构化输出:使用编译后的字节级语法,确保输出符合工具模式的 JSON 格式。
- 集成式流程:包含合成数据生成、通过 JAX 进行 LoRA 微调,以及导出为紧凑的
.cact格式等工具。 - 预构建环境:提供针对智能家居、媒体播放器和可穿戴设备等领域的现成工具接口。
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 项目