Nehanth/swarmllm

Every device brings a slice. Together they run the whole model. Peer-to-peer LLM inference across browser tabs: a from-scratch WebGPU engine and a WebRTC runtime that split a 27B model over the devices in a room.

它解決了什麼問題

SwarmLLM 讓多個裝置(筆電、手機、個人電腦)能共同執行大型語言模型(LLM),這些模型對單一裝置的記憶體來說過於龐大。它透過 WebGPU 和 WebRTC 在瀏覽器分頁中執行模型,消除了對專門安裝、帳戶或中央伺服器的需求。

運作方式

此專案將模型的層級拆分到「房間」中的參與裝置上。每個裝置在自己的 GPU 上僅持有並處理模型權重的一部分。在推論期間,一個小型啟用向量(約 10 KB)會透過直接的點對點 WebRTC 連線在裝置之間傳遞。系統使用自訂的 WebGPU 引擎搭配 WGSL 核心來最佳化記憶體頻寬,並採用推測性解碼來減少網路延遲的影響。

適用對象

它專為想要在本機私下執行強大 LLM 而無需安裝軟體或僅需開啟 URL 的使用者設計。它也適合對高效能 WebGPU 推論引擎感興趣的開發者。

重點特色

  • 零安裝: 完全透過 URL 在瀏覽器分頁中執行。
  • 跨裝置相容性: 可在不同作業系統和硬體上運作(例如 MacBook 和 iPhone 一起使用)。
  • 跨網路支援: 房間可透過 WebRTC 跨越不同網路。
  • 高效能: 配備自訂 WGSL 引擎,在某些硬體上可達到接近原生的解碼速度。
  • 隱私導向: 沒有伺服器處理資料;對話僅限於點對點房間內。
  • 推測性解碼: 使用多 token 預測來維持速度,即使在較慢的網路連線上也是如此。

相關

  • 專案
  • 專案
  • 專案
  • 專案