leyten/shard
Pipeline-parallel LLM inference across GPUs on separate machines.
What it solves
Shard 解决了运行巨型 AI 模型、单个 GPU 内存(VRAM)不足的问题。它不依赖于集中式数据中心,而是让分散在各处的消费级 GPU 组成去中心化网络,池化资源,在开放的互联网中共同提供这些模型。
How it works
Shard 将 transformer 模型视为层的堆叠,并将其拆分为连续块。每个 GPU 在“群 swarm”中只持有模型的一部分层。生成 token 时,激活会按顺序在网络中流经这些分片。
为克服公共互联网(WAN)高延迟,Shard 采用了多项优化:
- Speculative Decoding:一个小且快速的“草稿”模型提出多个 token,随后大型分布式模型在一次传递中验证它们,摊销网络往返成本。
- Async Pipelining:多个验证块同时在飞行中,将瓶颈从网络延迟转移到系统吞吐量。
- CUDA-graphed Draft:草稿模型以 CUDA graph 捕获,降低启动开销,显著加速提案阶段。
- Direct Return:管线的最终阶段直接将结果返回协调者,减少网络跳数。
Who it’s for
它面向希望在无需单台巨型机器或高端企业硬件的情况下,使用无许可、去中心化计算网络运行前沿规模 AI 模型的用户和提供者。
Highlights
- Frontier-Scale Performance:已证明可在 WAN 上以约每秒 30 token 的速度服务 744B 参数模型(GLM-5.2)。
- Decentralized Architecture:没有单一节点持有完整模型;任何人只要有 GPU 即可加入网络。
- Permissionless Join:支持一键加入和跨异构 GPU 的动态层分配。
- Fault Tolerance:已展示在节点故障时能够在生成过程中恢复请求的能力。
- Secure Transport:使用经认证的加密(ChaCha20-Poly1305)和无 pickle 的帧结构,防止代码执行和窃听。