mlc-ai/web-llm

High-performance In-browser LLM Inference Engine

解決的問題

WebLLM 將高效率的大語言模型(LLM)推論直接帶入瀏覽器。無需伺服器端處理,讓 AI 應用可在使用者的硬體上本地執行,從而提升隱私保護並降低伺服器成本。

運作方式

WebLLM 利用 WebGPU 實現硬體加速,並使用 WebAssembly(WASM)達成最佳效能。它被設計為模組化的 npm 套件,可輕鬆整合至 Web 應用程式中。引擎支援多種快取後端(如 Cache API、IndexedDB 和 OPFS),用於在本地儲存模型權重,並可卸載至 Web Workers 或 Service Workers,以避免 UI 阻塞。

適用對象

希望在不管理後端基礎設施的情況下,為 AI 助手、聊天機器人或瀏覽器擴充功能提供本地 GPU 加速 LLM 功能的 Web 開發者。

主要特色

  • 完全相容 OpenAI API:可在各種開源模型中使用相同的 API 進行串流、JSON 模式與種子設定。
  • 瀏覽器內執行:完全在客戶端使用 WebGPU 執行,確保資料不會離開瀏覽器。
  • 廣泛模型支援:原生支援 Llama 3、Phi 3、Gemma、Mistral 和 Qwen。
  • 結構化生成:實作高效率的 JSON 模式,確保結構化輸出。
  • 彈性部署:支援透過 NPM、Yarn 或 CDN 集成,並可在 Chrome 擴充功能中運作。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案