b4rtaz/distributed-llama
Distributed LLM inference. Connect home devices into a powerful cluster to accelerate LLM inference. More devices means faster inference.
What it solves
Distributed Llama 讓使用者能透過將多台家用裝置(例如 PC、Mac Mini 或 Raspberry Pi)連結成單一強大叢集,來加速 LLM 推論。這解決了單機硬體資源受限的問題,使得原本因記憶體不足而無法執行的大型模型(如 Llama 3.1 405B)得以運行。
How it works
此專案使用張量平行化將神經網路切分至多個節點,並透過以太網連線。它採用根節點‑工作節點架構:
- Root Node:負責模型載入、權重分配與神經網路狀態同步,同時也作為工作節點處理自身的模型切片。
- Worker Nodes:處理分配給自己的神經網路切片,無需任何模型特定的設定。
系統支援 2 的次方數量的節點(1、2、4…2^n),並將 RAM 使用量分散至所有連線裝置。
Who it’s for
此工具適合擁有多台備用裝置、希望在本機執行大型 LLM 而不必購買高階企業級硬體的使用者。支援 Linux、macOS 與 Windows,並針對 ARM 與 x86_64 AVX2 CPU 以及透過 Vulkan 的 GPU 進行最佳化。
Highlights
- 跨平台支援:支援 Linux、macOS、Windows 與 Raspberry Pi。
- 廣泛模型支援:相容 Llama 3.1、3.2、3.3、DeepSeek R1 Distill 與 Qwen 3 系列模型。
- 硬體彈性:支援 CPU(ARM/x86_64)與 GPU(Vulkan)推論。
- 彈性部署:提供 CLI 聊天、效能基準測試工具與 API 伺服器。