exo-explore/exo
Run frontier AI locally.
解决的问题
exo 允许用户通过将多个设备聚合成一个集群,来在本地运行大型前沿 AI 模型。这解决了单台机器 VRAM 和算力受限的问题,使得原本无法在单个设备上运行的超大模型得以执行,同时随着硬件增加,运行速度也显著提升。
工作原理
exo 使用自动设备发现功能,将多个设备连接成一个统一的 AI 集群。它采用 MLX 作为推理后端,MLX distributed 作为通信框架。为优化性能,它利用拓扑感知的自动并行化,根据实时网络延迟和带宽将模型跨设备拆分。同时支持张量并行以提升速度,并利用 Thunderbolt 5 上的 RDMA 技术,大幅降低节点间的延迟。
适用人群
专为拥有多个 Apple Silicon Mac 或 Linux 机器的用户设计,他们希望在不依赖云服务提供商的情况下,本地运行大型 LLM(如 DeepSeek v3.1 或 Qwen3)。
核心亮点
- Thunderbolt 5 上的 RDMA:设备间延迟降低高达 99%。
- 自动发现:设备可在网络上自动相互发现,无需手动配置。
- 拓扑感知并行:根据硬件资源和网络链路,自动确定最高效的模型分片方式。
- 广泛的 API 兼容性:支持 OpenAI、Claude 和 Ollama API,可与现有 AI 工具无缝集成。
- 自定义模型支持:支持从 HuggingFace Hub 加载任意模型。
写过它的文章
相关
- 项目
- 项目
- 项目
- 项目