Picovoice/picollm

On-device LLM Inference Powered by X-Bit Quantization

解決的問題

picoLLM 是一個跨平台推理引擎,專為在多種硬體上本地執行壓縮的大規模語言模型(LLM)而設計,包括行動裝置、網頁瀏覽器以及樹莓派等單板電腦。它解決了在資源受限裝置上執行高準確度 LLM 的挑戰,同時透過將所有推論完全本地化來確保隱私。

工作原理

此引擎使用一種稱為 picoLLM Compression 的專有量化演算法。與使用固定位元分配的傳統技術不同,此演算法根據特定任務的成本函數,自動學習模型權重之間及內部的最優位元分配策略。此方法顯著降低了 GPTQ 等量化方法常見的準確度下降問題。

適用對象

針對在不同平台開發本地 AI 應用的開發者,包括 Android、iOS、Web(Chrome、Safari、Edge、Firefox)、Linux、macOS、Windows 與樹莓派。特別適合需要在 CPU 或 GPU 上部署開源權重模型,且不依賴雲端服務的使用者。

主要特色

  • 廣泛的硬體支援:可在桌面、行動裝置與網頁瀏覽器的 CPU 與 GPU 上執行。
  • 高準確度:在 2、3 和 4 位設定下,相比 GPTQ 显著恢復 MMLU 分數的下降。
  • 100% 本地推論:透過本地處理所有提示,確保資料隱私。
  • 廣泛的模型支援:相容多種開源權重模型,包括 Llama-3、Gemma、Mistral、Mixtral、Phi-3.5 以及用於 OCR 和視覺的專用模型。
  • 多語言 SDK:提供 Python、.NET、Node.js、Android、Java、Swift 與 C 的官方 SDK。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch