leyten/shard

Pipeline-parallel LLM inference across GPUs on separate machines.

What it solves

Shard 解決了執行過於龐大的 AI 模型、單一 GPU 記憶體(VRAM)無法容納的問題。它不依賴集中式資料中心,而是讓分散在各處的消費者 GPU 組成去中心化網路,將資源池化,於開放的互聯網上共同提供這些模型。

How it works

Shard 把 transformer 模型視為層的堆疊,將其切割成連續的區塊。每台 GPU 在「群 swarm」中只保有模型的一部份層。產生 token 時,激活值會依序在網路上穿過這些分片。

為了克服公共互聯網(WAN)高延遲的問題,Shard 採用了多項優化:

  • Speculative Decoding:一個小且快速的「草稿」模型提出多個 token,然後大型分散模型在一次傳遞中驗證它們,從而攤平網路往返的成本。
  • Async Pipelining:多個驗證區塊同時在飛行中,將瓶頸從網路延遲轉移到系統吞吐量。
  • CUDA-graphed Draft:草稿模型以 CUDA graph 捕獲,減少啟動開銷,顯著加速提案階段。
  • Direct Return:管線最後階段直接將結果返回協調者,減少網路跳數。

Who it’s for

此方案設計給想要在不需要單一巨型機器或高階企業硬體的情況下,使用無許可、去中心化的運算網路來執行前沿規模 AI 模型的使用者與提供者。

Highlights

  • Frontier-Scale Performance:已證明可在 WAN 上以約每秒 30 token 的速度服務 744B 參數模型(GLM-5.2)。
  • Decentralized Architecture:沒有單一節點持有完整模型;任何人只要有 GPU 即可加入網路。
  • Permissionless Join:支援一鍵加入與跨異構 GPU 的動態層分配。
  • Fault Tolerance:已展示在節點失效時能在生成過程中斷點續傳的能力。
  • Secure Transport:使用經驗證的加密(ChaCha20-Poly1305)與無 pickle 的框架,防止程式碼執行與竊聽。