MicroLLM Lab 通过 WebGPU 将 7 个微型 LLM 带入浏览器

摘要

MicroLLM Lab 使任何人都能完全在浏览器中通过 WebGPU 加载、聊天和基准测试七个小语言模型(25M–360M 参数),提供低于 10 毫秒的首令牌延迟、零服务器成本和完全隐私。

实验室提供的内容

答案: 该网站提供了一个 UI,让用户加载七个 Q4 量化模型中的任何一个,在设备上运行推理,并查看基准测试结果,无需任何后端。

  • 模型: PetitGPT‑research‑v1 (125M)、SmolLM2 135M Instruct、L20‑Edu 135M、SmolLM2 360M Instruct、MiniMind2 104M、MiniMind2 Small 26M、GPT‑2 124M(nanoGPT 形状)。所有模型均采用 Apache‑2.0 或 MIT 许可,4 位量化后大小从 15 MB 到 216 MB 不等。
  • 硬件加速: 当 WebGPU 可用时,推理在 GPU 上以 100–300 tokens/s 的速度运行(比 WASM 回退的 8–20 tok/s 快 10–20 倍)。UI 报告当前速度,并可生成可共享的性能证书。
  • 隐私与成本: 所有计算都在浏览器中完成;提示永远不会离开设备,也没有 API 费用。
  • 用例重点: 边缘分类、垃圾邮件过滤、意图提取,以及任何在调用大型云 LLM 之前可以使用廉价、超低延迟模型进行分诊的任务。

如何开始

答案: 加载模型是一个三步过程。

  1. 加载 – 点击模型卡片上的 Load 按钮;模型缓存在 IndexedDB 中(无需文件系统下载)。
  2. 聊天 – 选择已加载的模型并使用聊天面板发出提示;每秒令牌数实时显示。
  3. 基准测试 – 切换到 Benchmarks 选项卡运行一组客观测试(基于正则表达式的检查),并生成记录峰值和持续令牌速率的性能证书。

UI 还提供了一个 Custom eval 编辑器,用户可以在其中编写 JavaScript 基准测试定义。

技术基础

答案: 该实验室依赖四项关键技术。

  • 小语言模型 (SLM): 一个紧凑的 transformer(25M–360M 参数),专为边缘推理而非广泛知识设计。
  • Q4 量化: 权重以 4 位整数存储,将 100M 参数模型缩小到约 50 MB,同时保持生成质量。
  • WebGPU: 一个 W3C 标准,将计算着色器映射到原生 GPU API(Metal、DirectX 12、Vulkan)。当可用时,它比 WASM 回退提供 10–20 倍的加速。
  • IndexedDB 缓存: 模型在浏览器的私有存储中跨会话持久化,消除重复下载。

用户的性能观察

答案: 社区反馈突出了优点和痛点。

“令人印象深刻的是你现在可以在本地做多少事情。原本以为推理会慢得多,但出奇地流畅。” – Mbarley

“浏览器内执行的速度太疯狂了。非常适合没有后端的快速演示。” – hbroom

“在 CPU 回退上运行只有 8–20 tok/s;使用 WebGPU 则跃升至 100–300 tok/s,提升 10–20 倍。” – 实验室文档

报告的问题:

  • UI 密度和小文本使界面难以导航(demibabs 的评论)。
  • 某些浏览器(Firefox)缺乏 WebGPU 支持,导致诸如 GPUShaderStage is not defined 的错误(anonimous-emacs 和 langurmonkey 的评论)。
  • 模型输出可能无意义或重复,尤其是在较大的提示上(not2b、Schlagbohrer、botanrice 的评论)。

示例模型行为

答案: 模型表现出不同的能力。

  • PetitGPT research‑v1 正确解决算术问题,但有时会添加额外步骤:“2 + 2 = 4 … 所以,2 + 2 = 4 + 2。”
  • SmolLM2 360M 提供严重不准确的事实(例如,声称加利福尼亚州人口为 1.53 亿)。
  • L20‑Edu 可以生成看似合理的代码片段,但可能重复填充文本。

这些示例说明,虽然延迟出色,但事实准确性仍然有限。

社区扩展与相关项目

答案: 几位开发人员正在基于浏览器内 LLM 的相同想法进行构建。

  • tiny.tobelabs.com – 一个用于 Tiny Stories 模型和更大 QA 模型的极简 UI(atobe 的评论)。
  • sonistellar.com/lab – 另一个基于 WebGPU 的 LLM 游乐场(vs4vijay 的评论)。
  • Web Models API – 一个标准化浏览器 API 以在设备上运行开放权重模型的提案(kenzic 的评论)。
  • Three‑LLM – 使用 ThreeJS 的着色语言在浏览器中运行 LLM(bhouston 的评论)。

实际要点

答案: MicroLLM Lab 展示了 4 位量化的 SLM 可以在现代浏览器上以交互速度运行,使边缘 AI 对低成本、隐私保护的应用变得可行。

  • 何时使用: 实时分类、意图路由或原型设计,其中延迟和成本比深度事实知识更重要。
  • 何时不使用: 需要高事实准确性、多语言支持或复杂推理的任务;模型经常产生幻觉或重复。
  • 未来方向: 更广泛的 WebGPU 采用(尤其是在 Firefox 中)和改进的 UI/UX 将扩大可访问性。标准化设备上模型 API 可以进一步降低开发人员的门槛。

所有信息均来自 MicroLLM Lab 网站和上面链接的 Hacker News 讨论线程。

Sources

相关

  • Dispatch
  • 项目
  • Dispatch
  • 项目
  • 项目