leyten/shard
Pipeline-parallel LLM inference across GPUs on separate machines.
What it solves
Shard는 단일 GPU 메모리(VRAM)로는 수용할 수 없는 거대한 AI 모델을 실행하는 문제를 해결합니다. 중앙 집중식 데이터 센터에 의존하지 않고, 흩어져 있는 소비자용 GPU 네트워크가 자원을 풀링하여 개방된 인터넷을 통해 이러한 모델을 공동으로 제공합니다.
How it works
Shard는 transformer 모델을 레이어 스택으로 간주하고 이를 연속적인 블록으로 나눕니다. "swarm" 내 각 GPU는 모델의 일부 레이어만 보유합니다. 토큰을 생성할 때 활성값은 네트워크를 통해 순차적으로 이러한 샤드들을 통과합니다.
공용 인터넷(WAN)의 높은 지연 시간을 극복하기 위해 Shard는 여러 최적화를 적용합니다:
- Speculative Decoding: 작고 빠른 "draft" 모델이 여러 토큰을 제안하고, 대형 분산 모델이 이를 한 번에 검증함으로써 네트워크 왕복 비용을 상쇄합니다.
- Async Pipelining: 여러 검증 청크를 동시에 진행시켜 병목을 네트워크 지연에서 시스템 처리량으로 이동시킵니다.
- CUDA-graphed Draft: draft 모델을 CUDA 그래프로 캡처해 런치 오버헤드를 줄이고 제안 단계 속도를 크게 높입니다.
- Direct Return: 파이프라인 최종 단계에서 결과를 코디네이터에게 직접 반환해 네트워크 홉 수를 감소시킵니다.
Who it’s for
단일 거대 머신이나 고급 엔터프라이즈 하드웨어 없이도 프론티어 규모 AI 모델을 실행할 수 있는 허가 없는 탈중앙화 컴퓨트 네트워크를 원하는 사용자와 제공자를 위해 설계되었습니다.
Highlights
- Frontier-Scale Performance: WAN 상에서 약 초당 30 토큰 속도로 744B 파라미터 모델(GLM-5.2)을 제공할 수 있음이 입증되었습니다.
- Decentralized Architecture: 단일 노드가 전체 모델을 보유하지 않으며, GPU만 있으면 누구나 네트워크에 참여할 수 있습니다.
- Permissionless Join: 한 번의 명령으로 참여하고 이기종 GPU 간 동적 레이어 할당을 지원합니다.
- Fault Tolerance: 노드가 실패해도 생성 중인 요청을 실제로 재개할 수 있음을 보여주었습니다.
- Secure Transport: 인증된 암호화(ChaCha20-Poly1305)와 pickle‑free 프레이밍을 사용해 코드 실행 및 도청을 방지합니다.