leyten/shard

Pipeline-parallel LLM inference across GPUs on separate machines.

해결하는 문제

Shard는 단일 GPU의 VRAM으로는 처리할 수 없는 거대한 AI 모델을 실행하는 문제를 해결합니다. 오픈 인터넷(WAN) 상의 분산된 일반 소비자용 GPU 네트워크를 탈중앙화되고 허가 없이 연결하여 메모리와 계산 능력을 공유함으로써, GLM-5.2 744B와 같은 프론티어 규모 모델을 인터랙티브 속도로 제공할 수 있게 합니다.

작동 방식

Shard는 트랜스포머 모델의 레이어를 연속적인 블록으로 분할하고, 각 GPU에 하나의 블록(‘스웜’)을 할당합니다. 요청은 이러한 샤드를 순차적으로 스트리밍하여 활성화를 처리합니다. 공공 인터넷의 높은 지연을 극복하기 위해 Shard는 다음과 같은 핵심 최적화를 사용합니다:

  • 예측적 디코딩 (Speculative Decoding): 작은 빠른 '드래프트' 모델이 토큰을 제안하고, 대규모 분산 모델이 단일 파이프라인 탐색에서 이를 검증합니다.
  • 비동기 파이프라인 (Async Pipelining): 여러 검증 청크를 동시에 처리하여, 네트워크 지연에서 시스템 처리량으로의 버퍼를 이동시킵니다.
  • 링 직접 반환 (Ring Direct-Return): 체인의 마지막 노드가 결과를 직접 조정자에게 반환하여 네트워크 호프 수를 줄입니다.
  • CUDA-그래프화된 드래프트 (CUDA-Graphed Drafts): 드래프트 모델이 CUDA 그래프로 캡처되어 시작 오버헤드를 최소화합니다.

대상 사용자

중앙 집중식 데이터센터에 의존하지 않고, 검열되지 않으며, 탈중앙화되고 개인적인 분산 AI 컴퓨팅 네트워크를 구축하거나 사용하고자 하는 개발자 및 GPU 소유자.

주요 특징

  • 프론티어 규모 성능: 미국 6개 주의 GPU를 사용해 744B 파라미터 모델을 약 30 tok/s로 실행하는 것이 입증됨.
  • 허가 없이 참여 가능: 1명령어로 참여 가능하며, 이질적인 GPU 간의 동적 레이어 할당을 설계.
  • 손실 없는 샘플링: 단일 머신 환경과 비트 단위로 동일한 온도 및 top-p/top-k 샘플링을 지원.
  • 보안 트랜스포트: 코드 실행 및 도청을 방지하기 위해 인증되고 암호화된(ChaCha20-Poly1305) 피클 없는 프레임워크 사용.
  • 장애 내성: 요청 중 노드 장애 발생 시 예비 노드에서 요청이 재개되는 중간 요청 복구를 실증함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트