exo-explore/exo
Run frontier AI locally.
解決的問題
exo 允許使用者透過將多台設備聚合成一個叢集,於本地執行大型前沿 AI 模型。這解決了單一機器 VRAM 與運算能力受限的問題,使原本無法在單一裝置上執行的超大模型得以運行,同時隨著硬體增加,執行速度也顯著提升。
工作原理
exo 使用自動裝置發現功能,將多台裝置連接成一個統一的 AI 叢集。它採用 MLX 作為推論後端,MLX distributed 作為通訊框架。為優化效能,它利用拓撲感知的自動平行化,根據即時網路延遲與頻寬將模型跨裝置拆分。同時支援張量平行以提升速度,並利用 Thunderbolt 5 上的 RDMA 技術,大幅降低節點間的延遲。
適用對象
專為擁有數台 Apple Silicon Mac 或 Linux 電腦的使用者設計,他們希望在不依賴雲端服務提供商的情況下,於本地執行大型 LLM(如 DeepSeek v3.1 或 Qwen3)。
核心亮點
- Thunderbolt 5 上的 RDMA:裝置間延遲降低高達 99%。
- 自動發現:裝置可在網路上自動相互發現,無需手動設定。
- 拓撲感知平行:根據硬體資源與網路鏈路,自動決定最高效的模型分片方式。
- 廣泛的 API 兼容性:支援 OpenAI、Claude 和 Ollama API,可與現有 AI 工具無縫整合。
- 自訂模型支援:支援從 HuggingFace Hub 加載任意模型。
寫過它的文章
相關
- 專案
- 專案
- 專案
- 專案