Picovoice/picollm

On-device LLM Inference Powered by X-Bit Quantization

What it solves

它提供一个高度准确、跨平台的 SDK,用于在本地运行压缩的大型语言模型(LLM)。这消除了对云端推理的需求,确保数据隐私,并让 AI 能在从移动设备到单板电脑的广泛硬件上运行。

How it works

该引擎使用名为 picoLLM Compression 的专有量化算法。不同于标准的固定位分配方案,这种算法会根据任务特定的成本函数自动学习权重的最佳位分配策略,显著降低相较于 GPTQ 等方法的精度损失。

Who it’s for

为 Android、iOS、Web(Chrome、Safari、Edge、Firefox)、Linux、macOS、Windows 和 Raspberry Pi 开发本地 AI 应用的开发者。

Highlights

  • Local Inference:100% 在 CPU 与 GPU 上本地运行,最大化隐私。
  • Broad Model Support:兼容开放权重模型,包括 Llama-3、Gemma、Mistral、Mixtral、Phi-3.5 与 Qwen3-VL。
  • High Accuracy:恢复标准 GPTQ 量化导致的 MMLU 分数下降的大部分。
  • Multi-Platform SDKs:原生支持 Python、.NET、Node.js、Android、iOS、Web 与 C。