leyten/shard
Pipeline-parallel LLM inference across GPUs on separate machines.
解决的问题
Shard 解决了单个 GPU 的 VRAM 无法容纳巨大 AI 模型的问题。它构建了一个去中心化、无需许可的消费者级 GPU 网络,这些 GPU 分布在开放互联网(WAN)上,共享其内存和计算能力,从而能够以交互速度运行前沿规模的模型(如 GLM-5.2 744B)。
工作原理
Shard 将 Transformer 模型的层划分为连续的块,每个 GPU 分配一个块(称为“蜂群”)。请求通过按顺序流式传输这些分片的激活值来处理。为克服公共互联网的高延迟,Shard 采用了多项关键优化措施:
- 推测性解码(Speculative Decoding): 一个小型快速的“草稿”模型提出 token,然后由大型分布式模型在单次流水线遍历中进行验证。
- 异步流水线(Async Pipelining): 同时保持多个验证块在传输中,将瓶颈从网络延迟转移到系统吞吐量。
- 环形直接返回(Ring Direct-Return): 链中的最后一个节点直接将结果返回给协调器,减少网络跳数。
- CUDA 图化草稿(CUDA-Graphed Drafts): 草稿模型被捕捉为 CUDA 图,以最小化启动开销。
适用人群
希望构建或使用一个不受审查、去中心化且私密的分布式 AI 计算网络,避免依赖中心化数据中心的开发者和 GPU 拥有者。
主要亮点
- 前沿级性能: 已证明可在美国六个州的 GPU 上以约 30 tok/s 的速度运行 744B 参数模型。
- 无需许可加入: 支持一键加入,并可在异构 GPU 之间动态分配层。
- 无损采样: 支持与单机环境完全一致的温度、top-p/top-k 采样。
- 安全传输: 使用经过认证和加密(ChaCha20-Poly1305)的无 pickle 帧格式,防止代码执行和窃听。
- 容错能力: 已演示请求在生成过程中发生节点故障时,可从备用节点恢复并继续执行。
相关
- 项目
- 项目
- 项目
- 项目
- 项目