b4rtaz/distributed-llama

Distributed LLM inference. Connect home devices into a powerful cluster to accelerate LLM inference. More devices means faster inference.

What it solves

Distributed Llama 让用户能够通过将多台家庭设备(如 PC、Mac Mini 或 Raspberry Pi)连接成单一强大集群来加速 LLM 推理。这解决了单机硬件资源受限的问题,使得原本因内存不足而无法运行的大模型(如 Llama 3.1 405B)得以运行。

How it works

项目使用张量并行将神经网络拆分到多个节点,并通过以太网连接。它采用根节点‑工作节点架构:

  • Root Node:管理模型加载、权重分配以及神经网络状态同步,同时也作为工作节点处理自己的网络切片。
  • Worker Nodes:处理分配给自己的神经网络切片,无需任何模型特定配置。

系统支持 2 的幂次节点数量(1、2、4…2^n),并将 RAM 使用分摊到所有连接的设备上。

Who it’s for

它面向拥有多台闲置设备、希望在本地运行大型 LLM 而不必投资高端企业硬件的用户。支持 Linux、macOS 与 Windows,并针对 ARM 与 x86_64 AVX2 CPU 以及通过 Vulkan 的 GPU 进行优化。

Highlights

  • 跨平台支持:支持 Linux、macOS、Windows 与 Raspberry Pi。
  • 广泛模型支持:兼容 Llama 3.1、3.2、3.3、DeepSeek R1 Distill 与 Qwen 3 系列模型。
  • 硬件灵活性:支持 CPU(ARM/x86_64)和 GPU(Vulkan)推理。
  • 灵活部署:包括 CLI 聊天、基准测试工具和 API 服务器。