Nehanth/swarmllm

Every device brings a slice. Together they run the whole model. Peer-to-peer LLM inference across browser tabs: a from-scratch WebGPU engine and a WebRTC runtime that split a 27B model over the devices in a room.

它解决了什么问题

SwarmLLM 允许多个设备(笔记本电脑、手机、个人电脑)共同运行大型语言模型(LLM),这些模型对单个设备的内存来说过于庞大。它通过 WebGPU 和 WebRTC 在浏览器标签页中运行模型,消除了对专门安装、账户或中央服务器的需求。

工作原理

该项目将模型的层拆分到“房间”中的参与设备上。每个设备在自己的 GPU 上仅持有并处理模型权重的一部分。在推理期间,一个小的激活向量(约 10 KB)会通过直接的端到端 WebRTC 连接在设备之间传递。系统使用自定义的 WebGPU 引擎和 WGSL 内核来优化内存带宽,并采用推测解码来减少网络延迟的影响。

适用对象

它专为希望在没有安装软件或仅需打开 URL 的情况下本地和私密运行强大 LLM 的用户设计。它也适合对高性能 WebGPU 推理引擎感兴趣的开发者。

亮点

  • 零安装: 完全通过 URL 在浏览器标签页中运行。
  • 跨设备兼容性: 可在不同操作系统和硬件上工作(例如 MacBook 和 iPhone 一起使用)。
  • 跨网络支持: 房间可通过 WebRTC 跨越不同网络。
  • 高性能: 配备自定义 WGSL 引擎,在某些硬件上实现接近原生的解码速度。
  • 隐私优先: 没有服务器处理数据;对话仅限于点对点房间内。
  • 推测解码: 使用多 token 预测来维持速度,即使在较慢的网络链路上也是如此。

相关

  • 项目
  • 项目
  • 项目
  • 项目