MicroLLM Lab 透過 WebGPU 將 7 個微型 LLM 帶入瀏覽器
TL;DR
MicroLLM Lab 讓任何人都能完全在瀏覽器中透過 WebGPU 載入、聊天與評測七個小型語言模型(25M–360M 參數),提供低於 10 毫秒的首個 token 延遲、零伺服器成本與完全隱私。
這個 Lab 提供什麼
答案: 該網站提供一個 UI,讓使用者載入七個 Q4 量化模型中的任何一個,在裝置上執行推論,並在無需後端的情況下查看評測結果。
- 模型: PetitGPT‑research‑v1(125M)、SmolLM2 135M Instruct、L20‑Edu 135M、SmolLM2 360M Instruct、MiniMind2 104M、MiniMind2 Small 26M、GPT‑2 124M(nanoGPT 架構)。所有模型均採用 Apache‑2.0 或 MIT 授權,4‑bit 量化後大小介於 15 MB 到 216 MB 之間。
- 硬體加速: 當 WebGPU 可用時,推論在 GPU 上以 100–300 tokens/s 的速度執行(比 WASM 後備方案的 8–20 tok/s 快 10–20 倍)。UI 會顯示目前速度,並可產生可分享的效能證書。
- 隱私與成本: 所有運算都在瀏覽器中進行;提示詞永遠不會離開裝置,且沒有 API 費用。
- 使用案例焦點: 邊緣分類、垃圾郵件過濾、意圖提取,以及任何需要便宜、超低延遲模型在呼叫大型雲端 LLM 之前進行分流的工作。
如何開始
答案: 載入模型是一個三步驟流程。
- 載入 – 點擊模型卡上的 Load 按鈕;模型會快取在 IndexedDB 中(無需檔案系統下載)。
- 聊天 – 選擇已載入的模型,使用聊天面板發出提示詞;每秒 token 數會即時顯示。
- 評測 – 切換到 Benchmarks 標籤,執行一系列客觀測試(基於正規表達式的檢查),並產生記錄峰值與持續 token 速率的效能證書。
UI 也提供 Custom eval 編輯器,使用者可以撰寫 JavaScript 評測定義。
技術基礎
答案: 這個 Lab 依賴四項關鍵技術。
- 小型語言模型(SLM): 一個緊湊的 transformer(25M–360M 參數),專為邊緣推論而非廣泛知識設計。
- Q4 量化: 權重以 4‑bit 整數儲存,將 100M 參數模型縮小至約 50 MB,同時保持生成品質。
- WebGPU: 一個 W3C 標準,將計算著色器對應到原生 GPU API(Metal、DirectX 12、Vulkan)。當可用時,比 WASM 後備方案快 10–20 倍。
- IndexedDB 快取: 模型在瀏覽器的私有儲存中跨工作階段持久化,消除重複下載。
使用者的效能觀察
答案: 社群回饋凸顯了優點與痛點。
「令人印象深刻,現在可以在本地做這麼多事。原本預期推論會慢很多,但出乎意料地流暢。」 – Mbarley
「在瀏覽器中執行的速度太驚人了。非常適合不需要後端的快速示範。」 – hbroom
「在 CPU 後備方案上只有 8–20 tok/s;使用 WebGPU 則跳到 100–300 tok/s,提升 10–20 倍。」 – Lab 文件
回報的問題:
- UI 密度與小文字讓介面難以導覽(demibabs 的評論)。
- 某些瀏覽器(Firefox)缺乏 WebGPU 支援,導致如
GPUShaderStage is not defined的錯誤(anonimous-emacs 和 langurmonkey 的評論)。 - 模型輸出可能無意義或重複,尤其是在較大的提示詞上(not2b、Schlagbohrer、botanrice 的評論)。
範例模型行為
答案: 這些模型展現了不同的能力。
- PetitGPT research‑v1 正確解決算術但有時會增加額外步驟:「2 + 2 = 4 … 所以,2 + 2 = 4 + 2。」
- SmolLM2 360M 提供嚴重不準確的事實(例如聲稱加州人口為 1.53 億)。
- L20‑Edu 可以生成看似合理的程式碼片段,但可能重複填充文字。
這些範例說明,雖然延遲表現優異,但事實準確性仍然有限。
社群擴充與相關專案
答案: 幾位開發者正在基於瀏覽器內 LLM 的相同想法進行建構。
- tiny.tobelabs.com – 一個極簡 UI,用於 Tiny Stories 模型和較大的 QA 模型(atobe 的評論)。
- sonistellar.com/lab – 另一個基於 WebGPU 的 LLM 遊樂場(vs4vijay 的評論)。
- Web Models API – 一個標準化瀏覽器 API 的提案,用於在裝置上執行開放權重模型(kenzic 的評論)。
- Three‑LLM – 使用 ThreeJS 的著色語言在瀏覽器中執行 LLM(bhouston 的評論)。
實務要點
答案: MicroLLM Lab 展示了 4‑bit 量化的 SLM 可以在現代瀏覽器上以互動速度執行,使邊緣 AI 在低成本、保護隱私的應用中變得可行。
- 何時使用: 即時分類、意圖路由或原型開發,當延遲和成本比深度事實知識更重要時。
- 何時不使用: 需要高事實準確性、多語言支援或複雜推理的工作;這些模型經常產生幻覺或重複。
- 未來方向: 更廣泛的 WebGPU 採用(尤其是 Firefox)和改善的 UI/UX 將擴大可用性。標準化裝置端模型 API 可以進一步降低開發者的門檻。
所有資訊均來自 MicroLLM Lab 網站及上方連結的 Hacker News 討論串。
Sources
相關
- Dispatch
- 專案
- Dispatch
- 專案
- 專案