MicroLLM LabがWebGPU経由で7つの小型LLMをブラウザに提供

TL;DR

MicroLLM Labは、WebGPUを介して7つの小型言語モデル(25M〜360Mパラメータ)を完全にブラウザ内で読み込み、チャットし、ベンチマークすることを可能にし、10ms未満の初回トークン生成までのレイテンシ、サーバーコストゼロ、完全なプライバシーを提供します。

ラボが提供するもの

回答: このサイトは、7つのQ4量子化モデルのいずれかを読み込み、デバイス上で推論を実行し、バックエンドなしでベンチマーク結果を表示できるUIを提供します。

  • モデル: PetitGPT‑research‑v1 (125M)、SmolLM2 135M Instruct、L20‑Edu 135M、SmolLM2 360M Instruct、MiniMind2 104M、MiniMind2 Small 26M、GPT‑2 124M(nanoGPT形状)。すべてのモデルはApache‑2.0またはMITライセンスで、4ビット量子化後は15MBから216MBの範囲です。
  • ハードウェアアクセラレーション: WebGPUが利用可能な場合、推論はGPU上で100〜300トークン/秒で実行されます(WASMフォールバックの8〜20トークン/秒より10〜20倍高速)。UIは現在の速度を報告し、共有可能なパフォーマンス証明書を生成できます。
  • プライバシーとコスト: すべての計算はブラウザ内で行われ、プロンプトがデバイスから送信されることはなく、API費用もかかりません。
  • ユースケースの焦点: エッジ分類、スパムフィルタリング、意図抽出、そして大規模なクラウドLLMを呼び出す前に安価で超低レイテンシのモデルがトリアージできるあらゆるタスク。

始め方

回答: モデルの読み込みは3ステップのプロセスです。

  1. 読み込み – モデルカードの読み込みボタンをクリックします。モデルはIndexedDBにキャッシュされます(ファイルシステムへのダウンロードはありません)。
  2. チャット – 読み込んだモデルを選択し、チャットパネルを使用してプロンプトを発行します。1秒あたりのトークン数がライブで表示されます。
  3. ベンチマーク – ベンチマークタブに切り替えて、一連の客観的テスト(正規表現ベースのチェック)を実行し、ピークおよび持続トークンレートを記録するパフォーマンス証明書を生成します。

UIには、ユーザーがJavaScriptのベンチマーク定義を記述できるカスタム評価エディタも用意されています。

技術的基盤

回答: ラボは4つの主要技術に依存しています。

  • 小型言語モデル(SLM): 広範な知識ではなくエッジ推論用に設計されたコンパクトなトランスフォーマー(25M〜360Mパラメータ)。
  • Q4量子化: 重みは4ビット整数で保存され、100Mパラメータモデルを約50MBに縮小しながら生成品質を維持します。
  • WebGPU: コンピュートシェーダーをネイティブGPU API(Metal、DirectX 12、Vulkan)にマッピングするW3C標準。利用可能な場合、WASMフォールバックよりも10〜20倍の高速化を実現します。
  • IndexedDBキャッシュ: モデルはブラウザのプライベートストレージにセッション間で永続化され、繰り返しのダウンロードを排除します。

ユーザーからのパフォーマンス観察

回答: コミュニティのフィードバックは、長所と問題点の両方を浮き彫りにしています。

「ローカルでこれだけできるのは印象的です。もっと遅い推論を期待していましたが、驚くほど速いです。」 – Mbarley

「ブラウザ内実行の速度はすごいです。バックエンドなしのクイックデモに最適です。」 – hbroom

「CPUフォールバックでは8〜20トークン/秒しか出ませんが、WebGPUでは100〜300トークン/秒に跳ね上がり、10〜20倍の向上です。」 – ラボのドキュメント

報告された問題:

  • UIの密度と小さなテキストにより、インターフェースの操作が難しい(demibabsによるコメント)。
  • 一部のブラウザ(Firefox)はWebGPUをサポートしておらず、GPUShaderStage is not definedなどのエラーが発生します(anonimous-emacsおよびlangurmonkeyによるコメント)。
  • モデルの出力が無意味または反復的になることがあり、特に大きなプロンプトで顕著です(not2b、Schlagbohrer、botanriceによるコメント)。

サンプルモデルの動作

回答: モデルはさまざまな能力を示します。

  • PetitGPT research‑v1 は算数を正しく解きますが、余分なステップを追加することがあります:「2 + 2 = 4 … だから、2 + 2 = 4 + 2。」
  • SmolLM2 360M は非常に不正確な事実を提供します(例:カリフォルニア州の人口が1億5300万人であると主張)。
  • L20‑Edu はもっともらしいコードスニペットを生成できますが、フィラーテキストを繰り返すことがあります。

これらの例は、レイテンシは優れている一方で、事実の正確性は限られていることを示しています。

コミュニティ拡張と関連プロジェクト

回答: 複数の開発者がブラウザ内LLMという同じアイデアに基づいて構築しています。

  • tiny.tobelabs.com – Tiny Storiesモデルとより大きなQAモデルのためのミニマルなUI(atobeによるコメント)。
  • sonistellar.com/lab – もう一つのWebGPUベースのLLMプレイグラウンド(vs4vijayによるコメント)。
  • Web Models API – オープンウェイトモデルをデバイス上で実行するための標準化されたブラウザAPIの提案(kenzicによるコメント)。
  • Three‑LLM – ThreeJSのシェーディング言語を使用してブラウザでLLMを実行します(bhoustonによるコメント)。

実用的な要点

回答: MicroLLM Labは、4ビット量子化されたSLMが最新のブラウザでインタラクティブな速度で実行でき、低コストでプライバシーを保護するアプリケーションにエッジAIを実現可能にすることを示しています。

  • 使用すべき場合: リアルタイム分類、意図ルーティング、またはレイテンシとコストが深い事実知識よりも重要であるプロトタイピング。
  • 使用すべきでない場合: 高い事実精度、多言語サポート、または複雑な推論を必要とするタスク。モデルはしばしば幻覚や繰り返しを起こします。
  • 将来の方向性: WebGPUのより広い採用(特にFirefox)と改善されたUI/UXは、アクセシビリティを広げるでしょう。オンデバイスモデルAPIの標準化は、開発者への障壁をさらに下げる可能性があります。

すべての情報は、MicroLLM Labサイトと上記のHacker Newsディスカッションスレッドから派生しています。

Sources

関連

  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト