Lumabri: 混合专家模型 (MoE) 的 P2P Swarm 推理
Lumabri 通过将模型权重和实际计算分布在点对点 (P2P) swarm 中,实现了大规模混合专家 (MoE) 模型的执行。与传统的将 transformer 层拆分到不同设备的分布式推理不同,Lumabri 在专家粒度上进行拆分,允许资源有限的节点(包括没有 GPU 的节点)参与推理过程。
分布式专家执行
Lumabri 通过仅在本地 "chatter" 机器上保留稠密权重、router 和 KV cache,从而针对 MoE 稀疏性进行了优化。当某个 token 需要使用某个专家时,chatter 会向持有该特定专家的 peer 发送一个很小的 4 KB activation。peer 会执行该专家并返回结果。
这种架构确保了专家权重永远不需要到达 chatter,与权重流式传输方法相比,显著降低了所需的带宽。由于 chatter 和 peers 都是基于相同的引擎源码构建的,其输出与本地运行的结果在字节级别上是完全一致的。为了防止由不同硬件指令(例如 -march=native)引起的静默错误,Lumabri 要求 peers 声明其精确的构建版本,包括 source hash、ISA 和 compiler;如果构建版本不同,chatter 将拒绝任何 peer。
P2P 模型分发与延迟加载
Lumabri 通过 LD_PRELOAD shim (liblumabri.so) 为模型字节实现了一种延迟加载机制。该 shim 拦截了标准的 libc 调用 (open, fopen, opendir, pread),使远程模型文件看起来像是稀疏的本地镜像。
- 按需获取: 只有当推理引擎实际触及这些字节时,才会从 peers 获取字节。
- 本地缓存: 一旦获取,字节就会存储在本地镜像和跨 checkpoint 共享的 content-addressed store (CAS) 中。后续对相同字节的请求将以全速从本地磁盘提供服务。
- 完整性: 模型的每一 MiB 都会通过 sha256 进行验证。Origin 可以使用 ed25519 密钥对模型 root 进行签名,允许 chatter 验证每个 block 块是否符合受信任的公钥。
在不可信 Swarm 中的信任与验证
由于 peers 并不受信任,Lumabri 采用了几种机制来确保远程计算的正确性:
- 副本验证 (Replica Verification):
LUMABRI_VERIFY=N设置允许 chatter 在第二个副本上重新运行一定比例的专家调用。如果两个诚实的 peers 意见不一,运行将停止,因为这证明了欺骗行为。 - 对冲请求 (Hedged Requests): 为了减轻慢速 peer 的延迟影响,
LUMABRI_HEDGE_MS=N可以在指定超时后向第二个副本发送重复请求,并使用收到的第一个有效的确定性结果。 - 加密传输: 当启用
LUMABRI_ENCRYPT=1时,token、模型 block 块和 activation 都会使用 X25519/Ed25519 握手和 ChaCha20-Poly1305 帧进行保护。
支持的引擎与模型
Lumabri 与 Colibri 引擎集成,支持多种 MoE 架构。每个引擎都需要一个基于引擎自身源码构建的特定专家节点二进制文件,以确保输出的确定性。
| Engine | Supported Model | Expert Node Provenance |
|---|---|---|
olmoe |
OLMoE | phase2_test.sh |
colibri |
GLM | phase2_glm_test.sh |
inkling |
Inkling | phase2_inkling_test.sh |
kimi_k3 |
Kimi K3 | phase2_kimi_test.sh |
deepseek |
DeepSeek V4 | phase2_deepseek_test.sh |
与其他 P2P 推理的比较
Lumabri 与 Petals 或 llama.cpp RPC 等项目的不同之处在于其划分点。虽然这些项目将连续的 transformer 层拆分到不同设备上——这通常需要高速 GPU 互连才能在实际应用中可行——但 Lumabri 是按专家进行拆分。这允许 swarm 在由 CPU 和 SSD 组成的网络中也能有效运行,因为在网络上传输的是 4 KB 的 activation,而不是整个层的 activation。
社区见解与使用场景
用户之间的讨论强调了 Lumabri 在局域网 (LAN) 中使用的潜力,例如汇集低功耗设备或 RAM 受限的 GPU 的资源。
"我看到的最大的好处是让 RAM 受限的 GPU 能够以惊人的高吞吐量对大参数模型进行推理... 网络上的内存与计算比仅受限于 activation,而不是权重。"
其他用户指出,这种架构可以作为防止云服务商进行中心化审查或监控的 "保险政策",将 LLM 推理回归到一种更去中心化、社区驱动的文化。
Sources
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目