lyogavin/airllm

AirLLM 70B inference with single 4GB GPU

解決的問題

AirLLM 允許使用者在 VRAM 非常有限的消費級硬體上執行巨大的大型語言模型(LLM)。它無需量化、蒸餾或剪枝,即可將超大模型(例如 Llama 3.1 405B 或 DeepSeek-V3 671B)部署至僅具備 4GB 至 12GB 記憶體的單一 GPU 上。

工作原理

AirLLM 不會將整個模型載入 GPU 記憶體,而是將模型分解並逐層流式傳輸。透過每次僅在 GPU 上保留一層,VRAM 的需求由單層大小決定,而非整個模型的大小。對於稀疏的混合專家(MoE)模型,它進一步優化,僅流式傳輸實際被 token 路由到的專家。

適用對象

希望在低階通用電腦或單一愛好者級 GPU 卡上執行前沿高參數 LLM,且不犧牲模型精確度的開發者與研究人員。

主要亮點

  • 極致記憶體效率:可在 4GB VRAM 上執行 70B 模型,於約 12GB VRAM 上執行 671B 模型。
  • 廣泛模型支援:相容 Llama、Qwen、DeepSeek、Mistral、Mixtral、Phi、Gemma 與 Kimi K3。
  • 廣泛硬體支援:支援 Linux、Windows 與 Apple Silicon(macOS)。
  • 可選加速:支援區塊式量化(4 位或 8 位),可減少磁碟載入瓶頸,將推論速度提升最高達 3 倍。
  • 簡單整合:使用與 Hugging Face transformers API 相似的 AutoModel 類別,便於快速採用。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案