mlc-ai/web-llm
High-performance In-browser LLM Inference Engine
解决的问题
WebLLM 将高性能大语言模型(LLM)推理直接带入浏览器。无需服务器端处理,使 AI 应用程序可在用户本地硬件上运行,从而增强隐私保护并降低服务器成本。
工作原理
WebLLM 利用 WebGPU 实现硬件加速,使用 WebAssembly(WASM)实现最佳性能。它被设计为一个模块化的 npm 包,可轻松集成到 Web 应用中。该引擎支持多种缓存后端(如 Cache API、IndexedDB 和 OPFS),用于在本地存储模型权重,并可卸载到 Web Workers 或 Service Workers,以防止 UI 阻塞。
适用人群
希望在不管理后端基础设施的情况下,为 AI 助手、聊天机器人或浏览器扩展提供本地 GPU 加速 LLM 能力的 Web 开发者。
主要亮点
- 完全兼容 OpenAI API:可在各种开源模型中使用相同的 API 进行流式传输、JSON 模式和种子设置。
- 浏览器内执行:完全在客户端使用 WebGPU 运行,确保数据不会离开浏览器。
- 广泛模型支持:原生支持 Llama 3、Phi 3、Gemma、Mistral 和 Qwen。
- 结构化生成:实现高性能 JSON 模式,确保结构化输出。
- 灵活部署:支持通过 NPM、Yarn 或 CDN 集成,并可在 Chrome 扩展中使用。
相关
- 项目
- 项目
- 项目
- 项目
- 项目