Picovoice/picollm

On-device LLM Inference Powered by X-Bit Quantization

What it solves

高精度でクロスプラットフォームな SDK を提供し、圧縮された大規模言語モデル(LLM)をローカルで実行します。これによりクラウドベースの推論が不要となり、データプライバシーが確保され、モバイルデバイスからシングルボードコンピュータまで幅広いハードウェアで AI を動作させることができます。

How it works

エンジンは picoLLM Compression と呼ばれる独自の量子化アルゴリズムを使用します。標準的な固定ビット割り当て方式とは異なり、このアルゴリズムはタスク固有のコスト関数に基づいて重みの最適なビット割り当て戦略を自動的に学習し、GPTQ などの手法に比べて精度損失を大幅に削減します。

Who it’s for

Android、iOS、Web(Chrome、Safari、Edge、Firefox)、Linux、macOS、Windows、Raspberry Pi 向けにローカル AI アプリケーションを構築する開発者向けです。

Highlights

  • Local Inference:CPU と GPU で 100% ローカル実行し、最大のプライバシーを実現。
  • Broad Model Support:Llama-3、Gemma、Mistral、Mixtral、Phi-3.5、Qwen3-VL などのオープンウェイトモデルに対応。
  • High Accuracy:標準的な GPTQ 量子化で見られる MMLU スコア低下の大部分を回復。
  • Multi-Platform SDKs:Python、.NET、Node.js、Android、iOS、Web、C のネイティブサポート。