Picovoice/picollm
On-device LLM Inference Powered by X-Bit Quantization
解决的问题
picoLLM 是一个跨平台推理引擎,旨在在各种硬件上本地运行压缩的大规模语言模型(LLM),包括移动设备、网页浏览器以及树莓派等单板计算机。它解决了在资源受限设备上运行高精度 LLM 的挑战,同时通过将所有推理完全本地化来确保隐私。
工作原理
该引擎使用一种名为 picoLLM Compression 的专有量化算法。与使用固定比特分配的标准技术不同,该算法基于特定任务的成本函数,自动学习模型权重之间及内部的最优比特分配策略。这种方法显著减少了 GPTQ 等量化方法中常见的精度下降问题。
适用人群
面向在不同平台上构建本地 AI 应用的开发者,包括 Android、iOS、Web(Chrome、Safari、Edge、Firefox)、Linux、macOS、Windows 和树莓派。特别适合需要在 CPU 或 GPU 上部署开源权重模型,而无需依赖云服务的用户。
主要亮点
- 广泛的硬件支持:可在桌面、移动设备和网页浏览器的 CPU 与 GPU 上运行。
- 高精度:在 2、3 和 4 位设置下,相比 GPTQ 显著恢复了 MMLU 分数的下降。
- 100% 本地推理:通过本地处理所有提示,确保数据隐私。
- 广泛的模型支持:兼容多种开源权重模型,包括 Llama-3、Gemma、Mistral、Mixtral、Phi-3.5 以及用于 OCR 和视觉的专用模型。
- 多语言 SDK:提供 Python、.NET、Node.js、Android、Java、Swift 和 C 的官方 SDK。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch