airllm: 소비자 GPU에서 한 번에 한 레이어씩 로드하여 massive LLMs를 실행하는 메모리 효율적인 추론 엔진

airllm: 소비자 GPU에서 한 번에 한 레이어씩 로드하여 massive LLMs를 실행하는 메모리 효율적인 추론 엔진

무엇을 해결하는가

AirLLM은 사용자가 매우 제한된 VRAM을 가진 소비자 등급 하드웨어에서 massive 대형 언어 모델(LLMs)을 실행할 수 있게 합니다. 이는 12GB VRAM만큼 적은 GPU에서 671B 파라미터 모델(예: DeepSeek-V3)을 실행하거나, 4GB 카드에서 70B 모델을 실행할 수 있게 하며, 양자화, 증류, 가지치기를 요구하지 않습니다.

어떻게 작동하는가

전체 모델을 GPU 메모리에 로드하는 대신, AirLLM은 모델을 분해하여 레이어별로 저장합니다. 추론 중에 GPU에 모델의 한 레이어만 유지하므로, VRAM 요구 사항은 전체 모델 크기가 아닌 단일 레이어의 크기에 의해 결정됩니다. 또한 디스크에서 가중치 크기를 줄이고 로딩 시간을 최대 3배까지 단축시키는 선택적 블록별 양자화(4비트 또는 8비트)를 지원합니다.

누구를 위한 것인가

낮은 사양의 범용 컴퓨터나 취미용 GPU에서 heavy quantization과 일반적으로 연관된 정확도 손실 없이 최신 상태의 massive 오픈소스 LLMs를 실행하고자 하는 개발자와 연구자를 위한 것입니다.

주요 특징

  • 극한 VRAM 효율성: 8GB VRAM에서 405B Llama 3.1을 실행하거나 12GB VRAM에서 DeepSeek-V3 (671B)를 실행합니다.
  • 광범위한 모델 지원: Llama (2/3/3.1/3.3/4), Qwen, DeepSeek, Mistral, Mixtral, Phi, Gemma, ChatGLM 등과 함께 작동합니다.
  • 양자화 없음 옵션: 가지치기나 증류 없이 전체 정밀도로 모델을 실행할 수 있는 기능.
  • 크로스 플랫폼: Linux 및 Apple Silicon (MacOS)를 지원합니다.
  • 단순성을 위해 코딩됨: 단일 AutoModel 클래스를 사용하여 Hugging Face에서 모델을 자동으로 감지하고 로드합니다.

SUMMARY: AirLLM은 하나의 모델 레이어만 VRAM에 로드하여 낮은 사양의 GPU에서 massive LLMs(최대 671B 파라미터)를 실행할 수 있게 하는 라이브러리입니다.

TITLE: airllm: 소비자 GPU에서 한 번에 한 레이어씩 로드하여 massive LLMs를 실행하는 메모리 효율적인 추론 엔진

Sources