airllm: 一種記憶體高效的推理引擎,透過一次載入一層來在消費級 GPU 上運行巨大的 LLM
它解決了什麼問題
AirLLM 允許使用者在 VRAM 非常有限的消費級硬體上運行巨大的大型語言模型(LLM)。它能在僅有 12GB VRAM 的 GPU 上運行多達 671B 參數的模型(如 DeepSeek-V3),或在 4GB 顯卡上運行 70B 模型,且無需進行量化、蒸餾或修剪。
它是如何運作的
與將整個模型載入 GPU 記憶體不同,AirLLM 會將模型分解並以層為單位儲存。在推理過程中,它僅會在 GPU 上保持模型的一層,這意味著 VRAM 需求由單一層的大小決定,而非整個模型的大小。它也支援可選的區塊級量化(4 位元或 8 位元),以減少磁碟上權重的大小並將載入時間提升最高 3 倍。
適合對象
希望在低端商用電腦或愛好者 GPU 上運行最先進、巨大的開源 LLM,且不想承受通常伴隨大量量化而來的精準度損失的開發者與研究者。
亮點
極致 VRAM 效率:在 8GB VRAM 上運行 405B Llama 3.1,或在 12GB VRAM 上運行 DeepSeek-V3(671B)。
廣泛模型支援:適用於 Llama (2/3/3.1/3.3/4)、Qwen、DeepSeek、Mistral、Mixtral、Phi、Gemma、ChatGLM 等。
無需量化選項:能夠在不進行修剪或蒸餾的情況下以全精度運行模型。
跨平台:支援 Linux 與 Apple Silicon(MacOS)。
簡潔編碼:使用單一
AutoModel類別自動偵測並從 Hugging Face 載入模型。
Sources
- Repolyogavin/airllm