Mesh-LLM/mesh-llm
Distributed AI/LLM for the people. Share compute privately or publicly to power your agents and chat.
해결하는 문제
Mesh LLM은 여러 머신에 걸쳐 GPU와 메모리 리소스를 통합하여, 단일 컴퓨터에서는 실행이 불가능한 대규모 언어 모델(LLM)을 실행할 수 있게 해줍니다. 통합된 OpenAI 호환 API를 제공하여 기존 AI 도구와 쉽게 통합할 수 있으며, 네트워크 상의 피어들 사이에서 계산 부하를 분산시킬 수 있습니다.
작동 방식
- 분산 라우팅: 메시 네트워크 내 모든 노드는 동일한 API를 노출합니다. 요청은 특정 모델을 호스팅할 수 있는 피어로 라우팅됩니다.
- 스키피 스테이지 분할: 단일 머신의 용량을 초과하는 모델의 경우, 시스템은 "스테이지 분할"을 사용하여 모델을 연속된 레이어 범위로 나누고 여러 노드에 분산합니다. 각 노드는 모델의 일부를 처리하고 활성화 값을 다음 스테이지로 전달합니다.
- 암호화 전송: 노드 간 트래픽(추론 요청 및 모델 활성화 등)은 QUIC를 사용하여 엔드투엔드 암호화됩니다.
- 디스커버리: 노드는 Nostr 디스커버리를 통해 공개 메시에 참여하거나, 초대 토큰을 사용하여 비공개 메시에 참여할 수 있습니다.
- 에이전트 혼합(MoA): 실험적 기능으로, 단일 프롬프트를 메시 내 모든 모델에 확장하고 응답을 조율한 후 하나의 통합된 응답을 반환합니다.
대상 사용자
- 하드웨어 제약이 있는 사용자: 소비자용 하드웨어에서 대규모 모델을 실행하고 싶은 사람.
- 개발자: 분산 LLM 서빙을 위한 OpenAI 호환 엔드포인트가 필요한 사람.
- 시스템 운영자: 개인 또는 공개 분산 추론 클러스터를 만들고 싶은 사람.
주요 특징
- OpenAI 호환 API: 기존 LLM 애플리케이션과의 원활한 통합.
- 광범위한 모델 지원: Qwen, Llama, Mistral, DeepSeek 등 다양한 GGUF 기반 모델 패밀리 지원.
- 크로스 플랫폼: macOS, Linux, Windows 지원 (CUDA, ROCm, Vulkan, Metal 지원).
- 동적 스케일링: 하나의 노드에서 시작하여 필요에 따라 메시에 노드를 추가할 수 있습니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트