mlc-ai/web-llm

High-performance In-browser LLM Inference Engine

何を解決するか

WebLLM は、ブラウザ内に高性能な大規模言語モデル(LLM)推論を直接持ち込みます。サーバーサイドの処理を必要とせず、ユーザーのハードウェア上でAIアプリケーションをローカルに実行できるため、プライバシーを強化し、サーバーのコストを削減できます。

動作方法

WebLLM は、ハードウェアアクセラレーションに WebGPU を、最適なパフォーマンスに WebAssembly(WASM)を使用します。モジュール形式の npm パッケージとして設計されており、Webアプリケーションに簡単に統合できます。モデルの重みをローカルに保存するため、Cache API、IndexedDB、OPFS などのさまざまなキャッシュバックエンドをサポートしており、UIのブロッキングを防ぐために Web Workers や Service Workers にオフロードすることも可能です。

対象ユーザー

バックエンドインフラを管理せずに、ローカルでGPUアクセラレーションされたLLM機能を提供したい、AIアシスタント、チャットボット、ブラウザ拡張機能を開発するWeb開発者。

主な特徴

  • 完全なOpenAI API互換性: ストリーミング、JSONモード、シード設定を含む、さまざまなオープンソースモデルで同じAPIを使用可能。
  • ブラウザ内実行: WebGPUを使用してクライアント側で完全に実行され、データがブラウザ外に流出することはありません。
  • 広範なモデル対応: Llama 3、Phi 3、Gemma、Mistral、Qwen をネイティブでサポート。
  • 構造化生成: 保証された構造化出力を実現する高パフォーマンスなJSONモードを実装。
  • 柔軟なデプロイ: NPM、Yarn、CDN での統合をサポートし、Chrome拡張機能内でも動作可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト