exo-explore/exo

Run frontier AI locally.

解決的問題

exo 允許使用者透過將多台設備聚合成一個叢集,於本地執行大型前沿 AI 模型。這解決了單一機器 VRAM 與運算能力受限的問題,使原本無法在單一裝置上執行的超大模型得以運行,同時隨著硬體增加,執行速度也顯著提升。

工作原理

exo 使用自動裝置發現功能,將多台裝置連接成一個統一的 AI 叢集。它採用 MLX 作為推論後端,MLX distributed 作為通訊框架。為優化效能,它利用拓撲感知的自動平行化,根據即時網路延遲與頻寬將模型跨裝置拆分。同時支援張量平行以提升速度,並利用 Thunderbolt 5 上的 RDMA 技術,大幅降低節點間的延遲。

適用對象

專為擁有數台 Apple Silicon Mac 或 Linux 電腦的使用者設計,他們希望在不依賴雲端服務提供商的情況下,於本地執行大型 LLM(如 DeepSeek v3.1 或 Qwen3)。

核心亮點

  • Thunderbolt 5 上的 RDMA:裝置間延遲降低高達 99%。
  • 自動發現:裝置可在網路上自動相互發現,無需手動設定。
  • 拓撲感知平行:根據硬體資源與網路鏈路,自動決定最高效的模型分片方式。
  • 廣泛的 API 兼容性:支援 OpenAI、Claude 和 Ollama API,可與現有 AI 工具無縫整合。
  • 自訂模型支援:支援從 HuggingFace Hub 加載任意模型。

寫過它的文章

相關

  • 專案
  • 專案
  • 專案
  • 專案