ChonkLM:通过 WebGPU 将小型语言模型带入浏览器
大型语言模型(LLM)的格局常常被庞大的参数量和对云端的高度依赖所主导。然而,向“微型”模型的趋势正在转向效率、隐私和本地执行。ChonkLM 是这一转变的典型例子,提供了一个专用的推理运行时,使用户能够直接在网页浏览器中离线运行小型语言模型(SLM)。
通过利用 WebGPU,ChonkLM 消除了对昂贵服务器端基础设施的需求,确保没有任何 token 会离开用户的设备。这种架构不仅提升了隐私,还降低了与 API 调用相关的延迟和成本。
通过 WebGPU 进行本地推理
从根本上说,ChonkLM 旨在实现易用性。它面向所有支持 WebGPU 的设备,使用户能够在不到两分钟的时间内开始本地 AI。其技术成就在于能够在浏览器沙箱中处理模型权重和执行,并利用客户端 GPU 加速。
平台采用缓存机制:用户选择模型后,将所需权重下载到本地浏览器缓存中,然后进行推理。这种“一次下载,随处运行(离线)”的方式,使其在网络不稳定的环境或对数据主权有严格要求的用户中成为可行的工具。
多样化的小模型库
ChonkLM 支持多种模型,涵盖从历史基线到前沿 SLM 的广泛范围。可用模型按主要功能——聊天、补全或专用任务——进行分类,并提供不同的量化等级(如 q4 和 q8),以在性能和内存占用之间取得平衡。
现代聊天与指令模型
- Gemma 3 (270M): Google 最新的小规模模型,提供多种量化版本(约 241 MB 至 278 MB)。
- LFM2.5 (350M): 针对聊天和结构化抽取优化的模型(约 219 MB 至 362 MB)。
- SmolLM2 (135M & 360M): Hugging Face 的高效指令模型,135M 版本仅占约 101 MB。
- Granite 4.0 H (350M): IBM 的混合 Mamba/Attention 模型,展示了超越标准 Transformer 的替代架构(约 213 MB 至 349 MB)。
专用与实验模型
- Qwen3 (0.6B): 较大的“微型”模型,引入了“思考”能力,需更多内存(约 462 MB 至 767 MB)。
- Monad 与 Baguettotron: 来自 PleIAs 的专用模型,包括法语专属聊天模型(Baguettotron)和单轮思考模型(Monad)。
- OpenELM (270M): Apple 的贡献,具备可变分组查询注意力(GQA)。
历史基线模型
对于关注本地 LLM 演进的用户,ChonkLM 包含了 OpenAI 的传统模型,如 GPT-2 和 distilgpt2,它们作为仅用于补全的基线,体积小至 81 MB。
“小型”趋势的技术意义
这些模型在浏览器运行时的可用性凸显了 AI 生态系统中的若干关键技术转变:
- 量化是必需的: 使用 GGUF 和 WGSL 格式,使这些模型能够在不显著损失实用性的前提下进行压缩(量化),从而适配消费者浏览器有限的显存。
- 架构多样性: IBM 的 Mamba‑混合模型和 Apple 的可变 GQA 的加入表明业界正在尝试非 Transformer 或改进版 Transformer 架构,以在更少参数下获取更高性能。
- 边缘智能: 将推理迁移至浏览器,ChonkLM 展示了一条通往“边缘 AI”的道路,即浏览器成为无需后端的智能体应用平台。
模型体积概览
| 模型系列 | 大小(约) | 主要使用场景 |
|---|---|---|
| SmolLM2-135M | 101MB - 138MB | 基础聊天 |
| LFM2.5-350M | 219MB - 362MB | 结构化抽取 |
| Gemma 3-270M | 241MB - 278MB | 通用聊天 |
| Qwen3-0.6B | 462MB - 767MB | 带思考的聊天 |
| GPT-2 | 108MB - 417MB | 补全基线 |