Nehanth/swarmllm

Every device brings a slice. Together they run the whole model. Peer-to-peer LLM inference across browser tabs: a from-scratch WebGPU engine and a WebRTC runtime that split a 27B model over the devices in a room.

해결하는 문제

SwarmLLM은 여러 기기(노트북, 휴대폰, PC)가 단일 기기 메모리에는 너무 큰 대규모 언어 모델(LLM)을 공동으로 실행할 수 있게 합니다. WebGPU와 WebRTC를 사용하여 브라우저 탭에서 모델을 실행함으로써 특수 설치, 계정, 중앙 서버의 필요성을 제거합니다.

작동 방식

이 프로젝트는 모델의 레이어를 "룸"에 참여한 기기들에 분할합니다. 각 기기는 모델 가중치의 일부만 자체 GPU에서 보유하고 처리합니다. 추론 중에는 약 10KB의 작은 활성화 벡터가 직접 P2P WebRTC 연결을 통해 기기 간에 전달됩니다. 시스템은 WGSL 커널을 사용하는 사용자 지정 WebGPU 엔진을 사용하여 메모리 대역폭을 최적화하고, 추측 디코딩을 사용하여 네트워크 지연의 영향을 줄입니다.

대상 사용자

소프트웨어를 설치하지 않고 URL만 열어 강력한 LLM을 로컬에서 비공개로 실행하려는 사용자를 위해 설계되었습니다. 또한 고성능 WebGPU 기반 추론 엔진에 관심이 있는 개발자에게도 적합합니다.

주요 기능

  • 제로 설치: URL을 통해 브라우저 탭에서 완전히 실행됩니다.
  • 크로스 디바이스 호환성: 다른 운영 체제와 하드웨어(예: MacBook과 iPhone을 함께)에서 작동합니다.
  • 크로스 네트워크 지원: WebRTC를 통해 룸이 다른 네트워크에 걸쳐 있을 수 있습니다.
  • 고성능: 일부 하드웨어에서 네이티브 수준의 디코딩 속도를 달성하는 사용자 지정 WGSL 엔진을 갖추고 있습니다.
  • 프라이버시 중심: 서버가 데이터를 처리하지 않으며 대화는 P2P 룸 내에서만 유지됩니다.
  • 추측 디코딩: 느린 네트워크 링크에서도 속도를 유지하기 위해 다중 토큰 예측을 사용합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트