lyogavin/airllm

AirLLM 70B inference with single 4GB GPU

해결하는 문제

AirLLM은 매우 제한된 VRAM을 가진 소비자용 하드웨어에서 거대한 대규모 언어 모델(LLM)을 실행할 수 있게 해줍니다. Llama 3.1 405B 또는 DeepSeek-V3 671B와 같은 거대한 모델을 4GB에서 12GB의 메모리만 있는 단일 GPU에 맞추기 위해 양자화, 정제, 또는 가지치기의 필요성을 제거합니다.

작동 방식

모델 전체를 GPU 메모리에 로드하는 대신, AirLLM은 모델을 분해하고 레이어 단위로 스트리밍합니다. 한 번에 GPU에 하나의 레이어만 유지함으로써 VRAM 요구량은 전체 모델 크기보다 단일 레이어의 크기로 결정됩니다. 희소한 전문가 혼합(MoE) 모델의 경우, 토큰이 실제로 라우팅되는 전문가만 스트리밍함으로써 추가 최적화를 수행합니다.

대상 사용자

저사양의 일반 컴퓨터나 단일 애호가용 GPU 카드에서 최신의 고파라미터 LLM을 정밀도를 희생하지 않고 실행하고자 하는 개발자 및 연구자.

주요 특징

  • 극도의 메모리 효율성: 4GB VRAM에서 70B 모델, 약 12GB VRAM에서 671B 모델 실행 가능.
  • 광범위한 모델 지원: Llama, Qwen, DeepSeek, Mistral, Mixtral, Phi, Gemma, Kimi K3와 호환.
  • 넓은 하드웨어 지원: Linux, Windows, Apple Silicon(MacOS)에서 작동 가능.
  • 선택적 속도 향상: 블록 단위 양자화(4비트 또는 8비트)를 지원하여 디스크 로딩 병목 현상을 줄이고 추론 속도를 최대 3배까지 향상시킬 수 있음.
  • 간편한 통합: Hugging Face transformers API와 유사한 AutoModel 클래스를 사용해 쉽게 도입 가능.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트