mlc-ai/web-llm
High-performance In-browser LLM Inference Engine
解決する課題
WebLLM は高性能な推論エンジンで、Large Language Models(LLM)を直接ウェブブラウザ内で実行できます。これによりサーバー側での処理が不要となり、ユーザーのハードウェアアクセラレーション(WebGPU)を活用してプライバシーを保護し、サーバーコストを削減します。
仕組み
WebLLM はハードウェアアクセラレーションに WebGPU、最適なパフォーマンスに WebAssembly(WASM)を使用します。モジュラーな npm パッケージとして設計されており、ウェブアプリに組み込むことが可能です。Cache API、IndexedDB、OPFS など複数のキャッシュバックエンドをサポートし、モデルの重みをブラウザにローカル保存できるため、毎回ダウンロードする必要がありません。UI の遅延を防ぐために Dedicated Web Workers や Service Workers にオフロードできます。
対象ユーザー
AI アシスタント、チャットボット、Chrome 拡張機能を開発しており、バックエンドインフラを管理せずにブラウザ内で LLM をローカルデプロイしたいウェブ開発者向けです。
ハイライト
- 完全な OpenAI API 互換性:OpenAI と同様のストリーミング、JSON モード、シーディング API を使用できます。
- WebGPU 加速:クライアント側だけで実行される高性能推論。
- 幅広いモデルサポート:Llama 3、Phi 3、Gemma、Mistral、Qwen をネイティブにサポート。
- 構造化 JSON 生成:最先端の JSON モードで構造化出力を保証。
- 柔軟なデプロイ:NPM、Yarn、CDN からの統合が可能で、Web Workers や Service Workers 内でも実行でき、パフォーマンスを向上させます。