b4rtaz/distributed-llama

Distributed LLM inference. Connect home devices into a powerful cluster to accelerate LLM inference. More devices means faster inference.

What it solves

Distributed Llama は、複数の家庭用デバイス(PC、Mac Mini、Raspberry Pi など)を単一の強力なクラスタに接続して LLM 推論を高速化します。これにより、単一マシンのハードウェアリソースが限られている問題を解決し、RAM 制限で実行できなかった大規模モデル(例:Llama 3.1 405B)を動かすことが可能になります。

How it works

本プロジェクトはテンソル並列化を用いてニューラルネットワークを複数ノードに分割し、イーサネットで接続します。ルート‑ワーカーモデルのアーキテクチャを採用しています:

  • Root Node:モデルのロード、重みの配布、ニューラルネットワーク状態の同期を管理します。また、自己のネットワークスライスを処理するワーカーとしても機能します。
  • Worker Nodes:割り当てられたネットワークスライスを処理し、モデル固有の設定は不要です。

システムは 2 のべき乗ノード数(1、2、4…2^n)をサポートし、接続されたすべてのデバイスに RAM 使用量を分散します。

Who it’s for

複数の予備デバイスを所有し、高価なエンタープライズハードウェアを導入せずにローカルで大規模 LLM を実行したいユーザー向けです。Linux、macOS、Windows をサポートし、ARM と x86_64 AVX2 CPU、さらに Vulkan 対応 GPU に最適化されています。

Highlights

  • クロスプラットフォーム対応:Linux、macOS、Windows、Raspberry Pi で動作。
  • 幅広いモデル対応:Llama 3.1、3.2、3.3、DeepSeek R1 Distill、Qwen 3 系列モデルに対応。
  • ハードウェアの柔軟性:CPU(ARM/x86_64)および GPU(Vulkan)での推論をサポート。
  • 柔軟なデプロイ:CLI チャット、ベンチマークツール、API サーバーを含む。