Mesh-LLM/mesh-llm

Distributed AI/LLM for the people. Share compute privately or publicly to power your agents and chat.

해결하는 문제

Mesh LLM은 여러 머신이 함께 작동하도록 하여 대규모 언어 모델 실행 시 발생하는 하드웨어 제한 문제를 해결합니다. 워크로드를 네트워크 노드에 분산시켜 단일 장치에서 실행하기에 너무 큰 모델을 실행할 수 있게 하며, 전체 클러스터에 대해 통합된 OpenAI 호환 API를 제공합니다.

작동 방식

이 시스템은 각 노드가 동일한 API를 노출하는 메쉬 아키텍처를 사용합니다. 요청이 도착하면 메쉬는 요청된 모델을 기반으로 적절한 피어(peer)로 라우팅합니다. 모델이 한 대의 머신에 너무 큰 경우, 시스템은 "Skippy stage splits"를 사용하여 모델 레이어를 서로 다른 노드에 분산시킵니다. 또한 단일 프롬프트를 메쉬 내의 여러 모델로 확장하여 중재하고 단일 응답을 반환할 수 있는 실험적인 "Mixture-of-Agents" 모드도 제공합니다.

대상 사용자

  • 개인 사용자: 기존의 여러 컴퓨터를 연결하여 거대한 모델을 실행하고자 하는 사용자.
  • 개발자: 분산 모델 추론을 위한 OpenAI 호환 인터페이스가 필요한 개발자.
  • 운영자: 공유 AI 컴퓨팅을 위해 프라이빗 또는 퍼블릭 하드웨어 메쉬를 구축하려는 운영자.

주요 특징

  • 분산 추론: 여러 머신에 걸쳐 GPU 및 메모리 풀링.
  • OpenAI 호환성: 기존 도구와 쉽게 통합할 수 있도록 표준 /v1 API 제공.
  • 스테이지 분할: Skippy 런타임을 사용하여 큰 모델을 노드 간에 관리 가능한 레이어로 분할.
  • 메쉬 디스커버리: Nostr를 통한 퍼블릭 디스커버리 또는 초대 토큰을 통한 프라이빗 메쉬 지원.
  • 멀티 모델 중재: 여러 모델의 응답을 집계하는 실험적인 Mixture-of-Agents (MoA) 기능.