Nehanth/swarmllm

Every device brings a slice. Together they run the whole model. Peer-to-peer LLM inference across browser tabs: a from-scratch WebGPU engine and a WebRTC runtime that split a 27B model over the devices in a room.

解決する課題

SwarmLLM は、複数のデバイス(ラップトップ、スマートフォン、PC)が、単一デバイスのメモリでは大きすぎる大規模言語モデル(LLM)を集合的に実行できるようにします。WebGPU と WebRTC を使用してブラウザタブでモデルを実行することで、特別なインストール、アカウント、中央サーバーの必要性を排除します。

仕組み

このプロジェクトは、モデルのレイヤーを「ルーム」内の参加デバイスに分割します。各デバイスは、モデルの重みの一部のみを自身の GPU 上で保持し処理します。推論中は、約 10 KB の小さな活性化ベクトルが、直接のピアツーピア WebRTC 接続を介してデバイス間で渡されます。システムは、WGSL カーネルを備えたカスタム WebGPU エンジンを使用してメモリ帯域幅を最適化し、投機的デコードを採用してネットワーク遅延の影響を軽減します。

対象読者

ソフトウェアをインストールせずに、または単に URL を開くだけで、強力な LLM をローカルかつプライベートに実行したいユーザー向けに設計されています。また、高性能な WebGPU ベースの推論エンジンに興味のある開発者にも適しています。

ハイライト

  • ゼロインストール: URL を介してブラウザタブ内で完全に実行。
  • クロスデバイス互換性: 異なる OS やハードウェア(例:MacBook と iPhone を一緒に)で動作。
  • クロスネットワークサポート: WebRTC を介してルームが異なるネットワークにまたがることが可能。
  • 高性能: 一部のハードウェアでネイティブ並みのデコード速度を実現するカスタム WGSL エンジンを搭載。
  • プライバシー重視: サーバーがデータを処理することはなく、会話はピアツーピアのルーム内に留まります。
  • 投機的デコード: マルチトークン予測を使用して、低速なネットワークリンクでも速度を維持します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト