mlc-ai/web-llm
High-performance In-browser LLM Inference Engine
解決的問題
WebLLM 將高效率的大語言模型(LLM)推論直接帶入瀏覽器。無需伺服器端處理,讓 AI 應用可在使用者的硬體上本地執行,從而提升隱私保護並降低伺服器成本。
運作方式
WebLLM 利用 WebGPU 實現硬體加速,並使用 WebAssembly(WASM)達成最佳效能。它被設計為模組化的 npm 套件,可輕鬆整合至 Web 應用程式中。引擎支援多種快取後端(如 Cache API、IndexedDB 和 OPFS),用於在本地儲存模型權重,並可卸載至 Web Workers 或 Service Workers,以避免 UI 阻塞。
適用對象
希望在不管理後端基礎設施的情況下,為 AI 助手、聊天機器人或瀏覽器擴充功能提供本地 GPU 加速 LLM 功能的 Web 開發者。
主要特色
- 完全相容 OpenAI API:可在各種開源模型中使用相同的 API 進行串流、JSON 模式與種子設定。
- 瀏覽器內執行:完全在客戶端使用 WebGPU 執行,確保資料不會離開瀏覽器。
- 廣泛模型支援:原生支援 Llama 3、Phi 3、Gemma、Mistral 和 Qwen。
- 結構化生成:實作高效率的 JSON 模式,確保結構化輸出。
- 彈性部署:支援透過 NPM、Yarn 或 CDN 集成,並可在 Chrome 擴充功能中運作。
相關
- 專案
- 專案
- 專案
- 專案
- 專案