Picovoice/picollm

On-device LLM Inference Powered by X-Bit Quantization

What it solves

它提供一個高度精確、跨平台的 SDK,用於在本地執行壓縮的大型語言模型(LLM)。此舉消除了對雲端推論的需求,確保資料隱私,並讓 AI 能在從行動裝置到單板電腦的廣泛硬體上運行。

How it works

此引擎使用名為 picoLLM Compression 的專有量化演算法。與標準的固定位元分配方案不同,該演算法會根據任務特定的成本函數自動學習權重的最佳位元分配策略,較之 GPTQ 等方法大幅降低精度損失。

Who it’s for

開發本地 AI 應用的開發者,支援 Android、iOS、Web(Chrome、Safari、Edge、Firefox)、Linux、macOS、Windows 與 Raspberry Pi。

Highlights

  • Local Inference:100% 在 CPU 與 GPU 上本地執行,確保最高隱私。
  • Broad Model Support:相容於開放權重模型,包括 Llama-3、Gemma、Mistral、Mixtral、Phi-3.5 與 Qwen3-VL。
  • High Accuracy:恢復標準 GPTQ 量化所見的 MMLU 分數下降的大部分。
  • Multi-Platform SDKs:原生支援 Python、.NET、Node.js、Android、iOS、Web 與 C。