exo-explore/exo
Run frontier AI locally.
해결하는 문제
exo는 여러 장치를 클러스터링하여 대규모 선도 AI 모델을 로컬에서 실행할 수 있게 해줍니다. 이는 단일 머신의 제한된 VRAM과 컴퓨팅 능력 문제를 해결하며, 한 대의 장치에 맞지 않는 너무 큰 모델을 실행할 수 있게 해주고, 더 많은 하드웨어를 추가할수록 속도가 향상됩니다.
작동 방식
exo는 자동 장치 탐지 기능을 사용하여 여러 장치를 통합된 AI 클러스터로 연결합니다. 추론 백엔드로는 MLX를, 통신에는 MLX distributed를 사용합니다. 성능 최적화를 위해 실시간 네트워크 지연과 대역폭을 기반으로 모델을 장치 간에 분할하는 토폴로지 인식 자동 병렬 처리를 채택합니다. 또한 속도 향상을 위한 텐서 병렬 처리를 지원하며, Thunderbolt 5를 통한 RDMA를 활용해 노드 간 지연을 극적으로 감소시킵니다.
대상 사용자
복수의 Apple Silicon Mac 또는 Linux 머신을 보유하고 있으며, 클라우드 제공업체에 의존하지 않고 DeepSeek v3.1이나 Qwen3와 같은 거대한 LLM을 로컬에서 실행하고자 하는 사용자에게 적합합니다.
주요 특징
- Thunderbolt 5를 통한 RDMA: 장치 간 지연을 최대 99% 감소.
- 자동 탐지: 수동 설정 없이 네트워크 상에서 장치가 서로를 자동으로 발견.
- 토폴로지 인식 병렬 처리: 하드웨어 리소스와 네트워크 링크를 기반으로 모델을 가장 효율적으로 분할하는 방법을 자동으로 결정.
- 광범위한 API 호환성: OpenAI, Claude, Ollama API를 지원하여 기존 AI 도구와 호환 가능.
- 사용자 정의 모델 지원: HuggingFace 허브에서 어떤 모델도 로드 가능.
이 프로젝트를 다룬 글
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트