b4rtaz/distributed-llama
Distributed LLM inference. Connect home devices into a powerful cluster to accelerate LLM inference. More devices means faster inference.
What it solves
Distributed Llama 让用户能够通过将多台家庭设备(如 PC、Mac Mini 或 Raspberry Pi)连接成单一强大集群来加速 LLM 推理。这解决了单机硬件资源受限的问题,使得原本因内存不足而无法运行的大模型(如 Llama 3.1 405B)得以运行。
How it works
项目使用张量并行将神经网络拆分到多个节点,并通过以太网连接。它采用根节点‑工作节点架构:
- Root Node:管理模型加载、权重分配以及神经网络状态同步,同时也作为工作节点处理自己的网络切片。
- Worker Nodes:处理分配给自己的神经网络切片,无需任何模型特定配置。
系统支持 2 的幂次节点数量(1、2、4…2^n),并将 RAM 使用分摊到所有连接的设备上。
Who it’s for
它面向拥有多台闲置设备、希望在本地运行大型 LLM 而不必投资高端企业硬件的用户。支持 Linux、macOS 与 Windows,并针对 ARM 与 x86_64 AVX2 CPU 以及通过 Vulkan 的 GPU 进行优化。
Highlights
- 跨平台支持:支持 Linux、macOS、Windows 与 Raspberry Pi。
- 广泛模型支持:兼容 Llama 3.1、3.2、3.3、DeepSeek R1 Distill 与 Qwen 3 系列模型。
- 硬件灵活性:支持 CPU(ARM/x86_64)和 GPU(Vulkan)推理。
- 灵活部署:包括 CLI 聊天、基准测试工具和 API 服务器。