Mesh-LLM/mesh-llm

Distributed AI/LLM for the people. Share compute privately or publicly to power your agents and chat.

解决的问题

Mesh LLM 允许用户将多台机器的 GPU 和内存资源进行池化,运行原本单台计算机无法承载的大规模语言模型(LLMs)。它提供统一的 OpenAI 兼容 API,便于与现有 AI 工具集成,同时将计算负载分布在多个节点组成的网络中。

工作原理

  • 分布式路由:网格网络中的每个节点都暴露相同的 API。请求会被路由到能够托管所请求模型的对等节点。
  • Skippy 阶段拆分:对于超出任何单台机器容量的模型,系统使用「阶段拆分」,将模型划分为连续的层范围,并分布到多个节点。每个节点处理模型的一部分,并将激活值传递给下一阶段。
  • 加密传输:节点之间的流量(包括推理请求和模型激活值)使用 QUIC 进行端到端加密。
  • 发现机制:节点可通过 Nostr 发现加入公共网格,或通过邀请令牌加入私有网格。
  • 混合代理(MoA):一项实验性功能,将单个提示分发到网格中的每个模型,仲裁响应后返回一个统一的综合回复。

适用人群

  • 硬件受限用户:希望在消费级硬件上通过资源池化运行超大规模模型的人。
  • 开发者:需要 OpenAI 兼容端点用于分布式 LLM 服务的开发者。
  • 系统运维人员:希望创建私有或公共分布式推理集群的用户。

核心亮点

  • OpenAI 兼容 API:与现有 LLM 应用无缝集成。
  • 广泛模型支持:支持多种 GGUF 基础模型家族(Qwen、Llama、Mistral、DeepSeek 等)。
  • 跨平台支持:支持 macOS、Linux 和 Windows(支持 CUDA、ROCm、Vulkan 和 Metal)。
  • 动态扩展:可从单个节点开始,按需向网格中添加更多节点。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目