b4rtaz/distributed-llama
Distributed LLM inference. Connect home devices into a powerful cluster to accelerate LLM inference. More devices means faster inference.
What it solves
Distributed Llama는 여러 가정용 디바이스(PC, Mac Mini, Raspberry Pi 등)를 하나의 강력한 클러스터로 연결해 LLM 추론을 가속화합니다. 이는 단일 머신의 하드웨어 자원이 제한된 문제를 해결하여, RAM 제약으로 사용할 수 없었던 대형 모델(예: Llama 3.1 405B)을 실행할 수 있게 합니다.
How it works
이 프로젝트는 텐서 병렬화를 사용해 신경망을 여러 노드에 분산시키고 이더넷으로 연결합니다. 루트‑워커 아키텍처를 채택합니다:
- Root Node: 모델 로드, 가중치 분배, 신경망 상태 동기화를 관리하며, 자체 네트워크 슬라이스를 처리하는 워커 역할도 수행합니다.
- Worker Nodes: 할당된 신경망 슬라이스를 처리하며, 모델별 별도 설정이 필요 없습니다.
시스템은 2의 거듭제곱 개수의 노드(1, 2, 4…2^n)를 지원하고, 연결된 모든 디바이스에 RAM 사용량을 분산합니다.
Who it’s for
여러 대의 여분 디바이스를 보유하고 고가의 엔터프라이즈 하드웨어에 투자하지 않고 로컬에서 대형 LLM을 실행하고자 하는 사용자에게 설계되었습니다. Linux, macOS, Windows를 지원하며 ARM 및 x86_64 AVX2 CPU와 Vulkan 기반 GPU에 최적화되어 있습니다.
Highlights
- 크로스 플랫폼 지원: Linux, macOS, Windows, Raspberry Pi에서 동작.
- 광범위한 모델 지원: Llama 3.1, 3.2, 3.3, DeepSeek R1 Distill, Qwen 3 모델과 호환.
- 하드웨어 유연성: CPU(ARM/x86_64) 및 GPU(Vulkan) 추론 지원.
- 유연한 배포: CLI 채팅, 벤치마크 도구, API 서버 포함.