mlc-ai/web-llm

High-performance In-browser LLM Inference Engine

它解决了什么问题

WebLLM 是一个高性能的推理引擎,允许大型语言模型(LLM)直接在网页浏览器中运行。这消除了服务器端处理的需求,通过 WebGPU 利用用户自己的硬件加速,提升用户隐私并降低服务器成本。

它如何工作

WebLLM 使用 WebGPU 进行硬件加速,并使用 WebAssembly(WASM)实现最佳性能。它被设计为模块化的 npm 包,可集成到 Web 应用中。支持多种缓存后端(如 Cache API、IndexedDB 和 OPFS),将模型权重本地存储在浏览器中,避免每次都下载。为防止 UI 卡顿,可将计算卸载到 Dedicated Web Workers 或 Service Workers。

适用人群

想在浏览器本地部署 LLM、且不想管理后端基础设施的 AI 助手、聊天机器人或 Chrome 扩展开发者。

亮点

  • 完整的 OpenAI API 兼容性:使用与 OpenAI 相同的流式、JSON 模式和 seed API 方式。
  • WebGPU 加速:完全在客户端运行的高性能推理。
  • 广泛的模型支持:原生支持 Llama 3、Phi 3、Gemma、Mistral 和 Qwen。
  • 结构化 JSON 生成:最先进的 JSON 模式,保证结构化输出。
  • 灵活部署:支持通过 NPM、Yarn 或 CDN 集成,也可在 Web Workers 或 Service Workers 中运行以提升性能。