exo-explore/exo

Run frontier AI locally.

何を解決するか

exo は複数のデバイスをクラスタリングして、1台のマシンのメモリ容量を超える先端AIモデルをローカルで実行できるようにします。これにより、単一マシンのVRAMや計算能力の制限という問題を解決し、1台のデバイスに収まらないほど大きなモデルを実行可能にするとともに、追加のハードウェアで速度が向上します。

動作方法

exo は自動デバイス検出を使用して複数のデバイスを統合されたAIクラスタに接続します。推論バックエンドには MLX を、通信には MLX distributed を使用します。パフォーマンス最適化のため、リアルタイムのネットワーク遅延と帯域幅に基づいてモデルをデバイス間で分割するトポロジーアウェア自動並列処理を採用しています。また、速度向上のためのテンソル並列処理をサポートし、Thunderbolt 5 を介した RDMA を活用してノード間の遅延を大幅に削減しています。

対象ユーザー

複数の Apple Silicon Mac または Linux マシンをお持ちで、クラウドプロバイダーに依存せずに DeepSeek v3.1 や Qwen3 などの巨大な LLM をローカルで実行したいユーザー向けに設計されています。

主な特徴

  • Thunderbolt 5 を介した RDMA:デバイス間の遅延を最大99%削減。
  • 自動検出:手動設定なしでネットワーク上のデバイスが相互に発見可能。
  • トポロジーアウェア並列処理:ハードウェアリソースとネットワークリンクに基づき、モデルを最も効率的にシャーディングする方法を自動的に決定。
  • 広範なAPI互換性:OpenAI、Claude、Ollama API をサポートし、既存のAIツールと連携可能。
  • カスタムモデル対応:HuggingFace ハブから任意のモデルをロード可能。

これを取り上げた記事

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト