ChonkLM:透過 WebGPU 將小型語言模型帶入瀏覽器
大型語言模型(LLM)的領域常被龐大的參數量與沉重的雲端依賴所主導。然而,日益興起的「tiny」模型趨勢正將焦點轉向效率、隱私與本地執行。ChonkLM 正是此轉變的典型範例,它提供一個專門的推論執行環境,讓使用者能在網頁瀏覽器中直接執行小型語言模型(SLM),且完全離線。
透過利用 WebGPU,ChonkLM 消除了昂貴的伺服器端基礎設施需求,確保任何 token 都不會離開使用者的裝置。此架構不僅提升了隱私,亦降低了 API 呼叫所帶來的延遲與成本。
透過 WebGPU 的本地推論
ChonkLM 的核心設計是為了易於取得。它支援任何支援 WebGPU 的裝置,讓使用者能在兩分鐘內開始使用本地 AI。此技術成就在於能在瀏覽器的沙箱環境中處理模型權重與執行,並利用客戶端 GPU 加速。
平台採用快取機制:使用者選擇模型後,將必要的權重下載至本地瀏覽器快取,接著執行推論。這種「一次下載,隨處執行(離線)」的方式,使其成為網路不穩或對資料主權有嚴格要求的環境中的可行工具。
多樣化的 Tiny 模型庫
ChonkLM 支援廣泛的模型,從歷史基線到最前沿的 SLM 均有涵蓋。可用模型依主要功能—聊天、補全或專門任務—分類,且提供不同的量化等級(如 q4、q8),以在效能與記憶體使用之間取得平衡。
現代聊天與指令模型
- Gemma 3 (270M): Google 最新的小規模模型,提供多種量化版本(約 241 MB 至 278 MB)。
- LFM2.5 (350M): 為聊天與結構化抽取優化的模型(約 219 MB 至 362 MB)。
- SmolLM2 (135M & 360M): Hugging Face 的高效指令模型,135M 版本僅佔 101 MB 左右。
- Granite 4.0 H (350M): IBM 的混合 Mamba/attention 模型,展示了除標準 Transformer 之外的替代架構(約 213 MB 至 349 MB)。
專門與實驗模型
- Qwen3 (0.6B): 較大的「tiny」模型,引入「思考」能力,需較多記憶體(約 462 MB 至 767 MB)。
- Monad & Baguettotron: 來自 PleIAs 的專門模型,包括法語專屬聊天模型(Baguettotron)與單回合思考模型(Monad)。
- OpenELM (270M): Apple 的貢獻,具備可變 Grouped-Query Attention(GQA)。
歷史基線
對於關心本地 LLM 演變的人而言,ChonkLM 也收錄了 OpenAI 的舊版模型,如 GPT-2 與 distilgpt2,作為僅供補全的基線,體積小至 81 MB。
「Tiny」趨勢的技術意涵
這些模型在瀏覽器執行環境中的可用性凸顯了 AI 生態系的幾項關鍵技術轉變:
- 量化是必須的: 使用 GGUF 與 WGSL 格式,使模型在不失顯著效用的前提下被壓縮(量化),以適應消費者瀏覽器有限的 VRAM。
- 架構多樣性: IBM 的 Mamba‑hybrid 與 Apple 的可變 GQA 顯示產業正嘗試非 Transformer 或改良版 Transformer 架構,以在更少參數中擠出更多效能。
- 邊緣智慧: 透過將推論搬至瀏覽器,ChonkLM 展示了一條通往「Edge AI」的道路,讓瀏覽器成為不需後端支援的智慧代理應用平台。
模型體積概覽
| 模型族群 | 大小(約) | 主要使用情境 |
|---|---|---|
| SmolLM2-135M | 101 MB - 138 MB | 基本聊天 |
| LFM2.5-350M | 219 MB - 362 MB | 結構化抽取 |
| Gemma 3-270M | 241 MB - 278 MB | 通用聊天 |
| Qwen3-0.6B | 462 MB - 767 MB | 具思考功能的聊天 |
| GPT-2 | 108 MB - 417 MB | 補全基線 |