airllm: 一個記憶體高效的推理引擎,透過一次載入一層來在消費級 GPU 上運行巨大的 LLM

airllm: 一個記憶體高效的推理引擎,透過一次載入一層來在消費級 GPU 上運行巨大的 LLM

它解決的問題

AirLLM 允許使用者在 VRAM 非常有限的消費級硬體上運行巨大的大型語言模型(LLM)。它能夠在僅有 12GB VRAM 的 GPU 上執行參數達到 671B(如 DeepSeek-V3)的模型,或在 4GB 顯卡上運行 70B 模型,而無需進行量化、蒸餾或修剪。

它是如何運作的

AirLLM 不會將整個模型載入 GPU 記憶體,而是將模型分解並以層為單位保存。在推理過程中,它僅在 GPU 上保持模型的一層,這意味著 VRAM 需求由單層的大小決定,而非整個模型的大小。它也支援可選的區塊級量化(4 位元或 8 位元),以減少磁碟上權重的大小並將載入時間提升最高達 3 倍。

適合對象

希望在低端通用電腦或愛好者 GPU 上運行最新狀態、巨大的開源 LLM,且不想承受通常與大量量化相關的準確度損失的開發者和研究者。

特點

  • 極致 VRAM 效率:在 8GB VRAM 上運行 405B Llama 3.1,或在 12GB VRAM 上運行 DeepSeek-V3 (671B)。
  • 廣泛模型支援:支援 Llama (2/3/3.1/3.3/4)、Qwen、DeepSeek、Mistral、Mixtral、Phi、Gemma、ChatGLM 等。
  • 無需量化選項:能夠在完整精度下運行模型,無需進行修剪或蒸餾。
  • 跨平台:支援 Linux 與 Apple Silicon (MacOS)。
  • 為求簡單而編碼:使用單一 AutoModel 類別自動偵測並從 Hugging Face 載入模型。

Sources