Mesh-LLM/mesh-llm
Distributed AI/LLM for the people. Share compute privately or publicly to power your agents and chat.
解决的问题
Mesh LLM 通过允许多台机器协同工作,解决了运行大语言模型时的硬件限制问题。它通过将工作负载分发到网络节点中,使用户能够运行单个设备无法承载的超大型模型,并为整个集群提供统一的 OpenAI 兼容 API。
工作原理
该系统采用网格(mesh)架构,每个节点都公开相同的 API。当请求到达时,网格会根据请求的模型将其路由到适当的对等节点。如果模型对于单台机器来说太大,系统会使用 "Skippy stage splits" 将模型层分发到不同的节点。它还具有实验性的 "Mixture-of-Agents" 模式,可以将单个提示词扩展到网格中的多个模型,进行仲裁并返回单个响应。
适用对象
- 个人用户:希望通过连接多台现有计算机来运行巨型模型的用户。
- 开发者:需要用于分布式模型推理的 OpenAI 兼容接口的开发者。
- 运营者:希望为共享 AI 计算构建私有或公共硬件网格的运营者。
亮点
- 分布式推理: 汇集多台机器的 GPU 和内存。
- OpenAI 兼容性: 提供标准的
/v1API,便于与现有工具集成。 - 阶段拆分: 使用 Skippy 运行时将大型模型拆分为可在各节点管理的层。
- 网格发现: 支持通过 Nostr 进行公共发现,或通过邀请令牌进行私有网格。
- 多模型仲裁: 实验性的 Mixture-of-Agents (MoA) 功能,用于聚合来自多个模型的响应。