Picovoice/picollm
On-device LLM Inference Powered by X-Bit Quantization
何を解決するか
picoLLM は、スマートフォンからウェブブラウザまで、さまざまなハードウェア上で圧縮された大規模言語モデル(LLM)をローカルで実行できるクロスプラットフォーム推論エンジンです。モバイルデバイス、ウェブブラウザ、Raspberry Pi などの単板コンピュータを含む幅広いハードウェアで動作します。リソース制約のあるデバイス上で高精度な LLM を実行する課題に対処し、すべての推論をローカルで行うことでプライバシーを確保します。
動作方法
このエンジンは、独自の量子化アルゴリズム「picoLLM Compression」を使用しています。従来の固定ビット割り当て技術とは異なり、このアルゴリズムはタスク固有のコスト関数に基づき、モデルの重み全体および内部で最適なビット割り当て戦略を自動的に学習します。このアプローチにより、GPTQ などの量子化手法で通常見られる精度の低下を大幅に軽減します。
対象ユーザー
Android、iOS、Web(Chrome、Safari、Edge、Firefox)、Linux、macOS、Windows、Raspberry Pi など、さまざまなプラットフォームでローカル AI アプリケーションを開発する開発者向けです。クラウドサービスに依存せずに CPU や GPU 上にオープンウェイトモデルをデプロイしたい方を対象としています。
特徴
- 広範なハードウェア対応:デスクトップ、モバイル、ウェブブラウザの CPU および GPU で動作可能。
- 高い精度:2ビット、3ビット、4ビット設定において、GPTQ と比較して MMLU スコアの低下を大幅に回復。
- 100% ローカル推論:すべてのプロンプトをローカルで処理することで、データのプライバシーを確保。
- 広範なモデル対応:Llama-3、Gemma、Mistral、Mixtral、Phi-3.5 および OCR やビジョン向けの専用モデルなど、多数のオープンウェイトモデルに対応。
- 多言語 SDK:Python、.NET、Node.js、Android、Java、Swift、C 用の公式 SDK を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch