Helldez/BigMoeOnEdge

Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

해결하는 문제

BigMoeOnEdge는 RAM이 제한된 장치(예: 스마트폰 또는 CPU만 사용하는 PC)에서 대규모 Mixture-of-Experts (MoE) 모델을 실행할 수 있게 해줍니다. 일반적으로 시스템 메모리보다 큰 모델은 로드를 거부하거나, 과도한 스왑(메모리 매핑 오류 폭풍)으로 인해 OS가 충돌하거나 느려지는 문제가 발생합니다.

작동 방식

모델 전체를 RAM에 로드하는 대신, 엔진은 플래시 스토리지를 메모리 계층의 일부로 간주합니다. 항상 필요한 핵심 부분만 메모리에 유지하고, 각 토큰 생성 시 필요한 특정 "에지언트"를 필요할 때 바로 플래시 스토리지에서 스트리밍합니다.

이것은 llama.cpp 공개 API 위에 구축되어 있어, llama.cpp가 지원하는 모든 양자화 형식과 토크나이저를 지원합니다. 병합 단계 없이 다중 샤드 GGUF 파일을 네이티브로 처리할 수 있습니다.

대상 사용자

메모리 제약이 심한 소비자 하드웨어(특히 안드로이드 폰 또는 CPU 전용 PC)에서 거대한 MoE 모델(예: 100B+ 파라미터)을 실행하고자 하는 개발자 및 AI 애호가들.

주요 특징

  • 극도의 메모리 효율성: 12GB RAM만 있는 스마트폰에서도 DeepSeek V4 Flash(284B 파라미터, 약 91GB)와 같은 모델을 실행 가능.
  • 손실 없는 스트리밍: 기본적으로 RAM에 완전히 로드된 경우와 바이트 수준에서 동일한 출력을 제공.
  • 성능 튜닝: 전용 캐시, 병렬 I/O 레인, "차가운" 에지언트 제거 또는 활성 에지언트 수 감소와 같은 손실 허용 최적화를 포함한 다양한 "노브"를 통해 속도와 품질의 균형 조절 가능.
  • 안드로이드 앱: 모델 다운로더와 실시간 텔레메트리(초당 토큰 수, 캐시 히트율)를 제공하는 즉시 사용 가능한 채팅 앱.
  • 광범위한 아키텍처 지원: Qwen, Gemma, DeepSeek, Liquid AI LFM2 등 다양한 MoE 아키텍처를 지원.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트