mlc-ai/web-llm
High-performance In-browser LLM Inference Engine
何を解決するか
WebLLM は、ブラウザ内に高性能な大規模言語モデル(LLM)推論を直接持ち込みます。サーバーサイドの処理を必要とせず、ユーザーのハードウェア上でAIアプリケーションをローカルに実行できるため、プライバシーを強化し、サーバーのコストを削減できます。
動作方法
WebLLM は、ハードウェアアクセラレーションに WebGPU を、最適なパフォーマンスに WebAssembly(WASM)を使用します。モジュール形式の npm パッケージとして設計されており、Webアプリケーションに簡単に統合できます。モデルの重みをローカルに保存するため、Cache API、IndexedDB、OPFS などのさまざまなキャッシュバックエンドをサポートしており、UIのブロッキングを防ぐために Web Workers や Service Workers にオフロードすることも可能です。
対象ユーザー
バックエンドインフラを管理せずに、ローカルでGPUアクセラレーションされたLLM機能を提供したい、AIアシスタント、チャットボット、ブラウザ拡張機能を開発するWeb開発者。
主な特徴
- 完全なOpenAI API互換性: ストリーミング、JSONモード、シード設定を含む、さまざまなオープンソースモデルで同じAPIを使用可能。
- ブラウザ内実行: WebGPUを使用してクライアント側で完全に実行され、データがブラウザ外に流出することはありません。
- 広範なモデル対応: Llama 3、Phi 3、Gemma、Mistral、Qwen をネイティブでサポート。
- 構造化生成: 保証された構造化出力を実現する高パフォーマンスなJSONモードを実装。
- 柔軟なデプロイ: NPM、Yarn、CDN での統合をサポートし、Chrome拡張機能内でも動作可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト