leyten/shard

Pipeline-parallel LLM inference across GPUs on separate machines.

解決的問題

Shard 解決了單一 GPU 的 VRAM 無法容納巨大 AI 模型的問題。它建立了一個去中心化、無需許可的消費者級 GPU 網路,這些 GPU 分散在開放互聯網(WAN)上,共享其記憶體與運算能力,從而能夠以互動速度運行前沿規模的模型(如 GLM-5.2 744B)。

工作原理

Shard 將 Transformer 模型的層劃分為連續的區塊,每個 GPU 分配一個區塊(稱為「蜂群」)。請求透過按順序串流這些分片的激活值來處理。為克服公共互聯網的高延遲,Shard 採用多項關鍵優化:

  • 預測性解碼(Speculative Decoding): 一個小型快速的「草稿」模型提出 token,然後由大型分散式模型在單次流水線遍歷中進行驗證。
  • 非同步流水線(Async Pipelining): 同時保持多個驗證區塊在傳輸中,將瓶頸從網路延遲轉移到系統吞吐量。
  • 環形直接回傳(Ring Direct-Return): 鏈中的最後一個節點直接將結果回傳給協調器,減少網路跳數。
  • CUDA 圖化草稿(CUDA-Graphed Drafts): 草稿模型被捕捉為 CUDA 圖,以最小化啟動開銷。

適用對象

希望建立或使用一個不受審查、去中心化且私密的分散式 AI 計算網路,避免依賴中心化資料中心的開發者與 GPU 擁有者。

主要亮點

  • 前沿級效能: 已證明可在美國六個州的 GPU 上以約 30 tok/s 的速度運行 744B 參數模型。
  • 無需許可加入: 支援一鍵加入,並可在異質 GPU 之間動態分配層。
  • 無損採樣: 支援與單機環境完全一致的溫度、top-p/top-k 採樣。
  • 安全傳輸: 使用經過認證與加密(ChaCha20-Poly1305)的無 pickle 幀格式,防止程式碼執行與竊聽。
  • 容錯能力: 已演示請求在生成過程中發生節點故障時,可從備用節點恢復並繼續執行。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案