Mesh-LLM/mesh-llm
Distributed AI/LLM for the people. Share compute privately or publicly to power your agents and chat.
解决的问题
Mesh LLM 允许用户将多台机器的 GPU 和内存资源进行池化,运行原本单台计算机无法承载的大规模语言模型(LLMs)。它提供统一的 OpenAI 兼容 API,便于与现有 AI 工具集成,同时将计算负载分布在多个节点组成的网络中。
工作原理
- 分布式路由:网格网络中的每个节点都暴露相同的 API。请求会被路由到能够托管所请求模型的对等节点。
- Skippy 阶段拆分:对于超出任何单台机器容量的模型,系统使用「阶段拆分」,将模型划分为连续的层范围,并分布到多个节点。每个节点处理模型的一部分,并将激活值传递给下一阶段。
- 加密传输:节点之间的流量(包括推理请求和模型激活值)使用 QUIC 进行端到端加密。
- 发现机制:节点可通过 Nostr 发现加入公共网格,或通过邀请令牌加入私有网格。
- 混合代理(MoA):一项实验性功能,将单个提示分发到网格中的每个模型,仲裁响应后返回一个统一的综合回复。
适用人群
- 硬件受限用户:希望在消费级硬件上通过资源池化运行超大规模模型的人。
- 开发者:需要 OpenAI 兼容端点用于分布式 LLM 服务的开发者。
- 系统运维人员:希望创建私有或公共分布式推理集群的用户。
核心亮点
- OpenAI 兼容 API:与现有 LLM 应用无缝集成。
- 广泛模型支持:支持多种 GGUF 基础模型家族(Qwen、Llama、Mistral、DeepSeek 等)。
- 跨平台支持:支持 macOS、Linux 和 Windows(支持 CUDA、ROCm、Vulkan 和 Metal)。
- 动态扩展:可从单个节点开始,按需向网格中添加更多节点。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目