leyten/shard
Pipeline-parallel LLM inference across GPUs on separate machines.
解決的問題
Shard 解決了單一 GPU 的 VRAM 無法容納巨大 AI 模型的問題。它建立了一個去中心化、無需許可的消費者級 GPU 網路,這些 GPU 分散在開放互聯網(WAN)上,共享其記憶體與運算能力,從而能夠以互動速度運行前沿規模的模型(如 GLM-5.2 744B)。
工作原理
Shard 將 Transformer 模型的層劃分為連續的區塊,每個 GPU 分配一個區塊(稱為「蜂群」)。請求透過按順序串流這些分片的激活值來處理。為克服公共互聯網的高延遲,Shard 採用多項關鍵優化:
- 預測性解碼(Speculative Decoding): 一個小型快速的「草稿」模型提出 token,然後由大型分散式模型在單次流水線遍歷中進行驗證。
- 非同步流水線(Async Pipelining): 同時保持多個驗證區塊在傳輸中,將瓶頸從網路延遲轉移到系統吞吐量。
- 環形直接回傳(Ring Direct-Return): 鏈中的最後一個節點直接將結果回傳給協調器,減少網路跳數。
- CUDA 圖化草稿(CUDA-Graphed Drafts): 草稿模型被捕捉為 CUDA 圖,以最小化啟動開銷。
適用對象
希望建立或使用一個不受審查、去中心化且私密的分散式 AI 計算網路,避免依賴中心化資料中心的開發者與 GPU 擁有者。
主要亮點
- 前沿級效能: 已證明可在美國六個州的 GPU 上以約 30 tok/s 的速度運行 744B 參數模型。
- 無需許可加入: 支援一鍵加入,並可在異質 GPU 之間動態分配層。
- 無損採樣: 支援與單機環境完全一致的溫度、top-p/top-k 採樣。
- 安全傳輸: 使用經過認證與加密(ChaCha20-Poly1305)的無 pickle 幀格式,防止程式碼執行與竊聽。
- 容錯能力: 已演示請求在生成過程中發生節點故障時,可從備用節點恢復並繼續執行。
相關
- 專案
- 專案
- 專案
- 專案
- 專案