ChonkLM: WebGPUを介してブラウザに小さな言語モデルをもたらす

Large Language Models (LLMs)の状況は、しばしば巨大なパラメータ数と重いクラウド依存によって支配されています。しかし、「tiny」モデルへの傾向が高まっていることで、効率性、プライバシー、ローカル実行への焦点がシフトしています。ChonkLMはこのシフトの代表例であり、ユーザーがウェブブラウザで直接小さな言語モデル(SLM)を完全にオフラインで実行できる専用の推論ランタイムを提供します。

WebGPUを活用することで、ChonkLMは高価なサーバーサイドインフラストラクチャの必要性をなくし、ユーザーのデバイスからトークンが決して離れないことを保証します。このアーキテクチャはプライバシーを向上させるだけでなく、APIコールに関連するレイテンシーとコストも削減します。

WebGPUを介したローカルインフェレンス

その核において、ChonkLMはアクセシビリティのために設計されています。WebGPUをサポートするあらゆるデバイスを対象とし、ユーザーが2分未満でローカルAIを始められるようにします。ここでの技術的成果は、ブラウザのサンドボックス内でモデルの重みと実行を処理し、クライアントのGPUを利用して加速できる能力です。

プラットフォームはキャッシュメカニズムで動作します:ユーザーはモデルを選択し、必要な重みをローカルブラウザキャッシュにダウンロードし、その後推論を実行します。この「一度ダウンロードすればどこでも(オフラインで)実行可能」なアプローチは、インターネット接続が不安定な環境や、データ主権要件が厳しいユーザーにとって有効なツールとなります。

多様なティニーモデルライブラリ

ChonkLMは、歴史的なベースラインから最先端のSLMまで幅広いモデルをサポートします。利用可能なモデルは、主な機能—チャット、補完、または専門タスク—によって分類され、パフォーマンスとメモリ使用量のバランスを取るために異なる量子化レベル(例えばq4とq8)で提供されます。

モダンなチャットおよびインストラクションモデル

  • Gemma 3 (270M): Googleの最新の小規模提供で、さまざまな量子化レベルで利用可能(約241MB〜278MB)。
  • LFM2.5 (350M): チャットと構造化抽出に最適化されたモデル(約219MB〜362MB)。
  • SmolLM2 (135M & 360M): Hugging Faceの効率的なインストラクションモデルで、135Mバージョンはわずか101MB程度で済みます。
  • Granite 4.0 H (350M): IBMのハイブリッドMamba/アテンションモデルで、標準のTransformerを超える代替アーキテクチャを示しています(約213MB〜349MB)。

特殊および実験的モデル

  • Qwen3 (0.6B): 「思考」機能を導入するより大きな「tiny」モデルで、より多くのメモリを必要とします(約462MB〜767MB)。
  • Monad & Baguettotron: PleIAsからの特殊モデルで、フランス語特化チャットモデル(Baguettotron)とシングルターン思考モデル(Monad)を含みます。
  • OpenELM (270M): Appleの貢献で、可変グループドクエリアテンション(GQA)を特徴とします。

歴史的ベースライン

ローカルLLMの進化に関心がある方のために、ChonkLMにはOpenAIのレガシーモデルであるGPT-2distilgpt2が含まれており、これらは完了専用のベースラインとして機能し、フットプリントはわずか81MBからです。

「ティニー」トレンドの技術的含意

これらのモデルがブラウザランタイムで利用可能になることで、AIエコシステムにおけるいくつかの重要な技術的シフトが浮き彫りになります:

  1. 量子化は必須: GGUFとWGSLフォーマットの使用により、これらのモデルは大きなユーティリティを失うことなく圧縮(量子化)され、コンシューマーブラウザの限られたVRAMに収まるようになります。
  2. アーキテクチャの多様性: IBMのMambaハイブリッドとAppleの可変GQAの組み込みは、業界が非Transformerまたは変更されたTransformerアーキテクチャを試し、少ないパラメータでより高いパフォーマンスを引き出そうとしていることを示します。
  3. エッジインテリジェンス: ブラウザに推論を移動させることで、ChonkLMは「Edge AI」への道を示しています。ここでブラウザはバックエンドを必要としないインテリジェントエージェントのアプリケーションプラットフォームとなります。

モデルフットプリントのサマリー

モデルファミリー サイズ(概算) 主なユースケース
SmolLM2-135M 101MB - 138MB 基本チャット
LFM2.5-350M 219MB - 362MB 構造化抽出
Gemma 3-270M 241MB - 278MB 一般チャット
Qwen3-0.6B 462MB - 767MB 思考を伴うチャット
GPT-2 108MB - 417MB 完了ベースライン

Sources