airllm: 一种内存高效的推理引擎,通过一次加载一层的方式在消费级 GPU 上运行巨大的 LLMs

airllm: 一种内存高效的推理引擎,通过一次加载一层的方式在消费级 GPU 上运行巨大的 LLMs

它解决的问题

AirLLM 使用户能够在 VRAM 非常有限的消费级硬件上运行巨大的大语言模型(LLM)。它能够在仅有 12GB VRAM 的 GPU 上运行多达 671B 参数的模型(如 DeepSeek-V3),或在 4GB 显卡上运行 70B 模型,而无需进行量化、蒸馏或剪枝。

它是如何工作的

AirLLM 不会一次性将整个模型加载到 GPU 内存中,而是将模型分解并按层保存。在推理过程中,它每次只将模型的一层保留在 GPU 上,这意味着 VRAM 需求由单层的大小决定,而不是整个模型的大小。它还支持可选的块级量化(4 位或 8 位),以减少磁盘上权重的大小,并将加载速度提高多达 3 倍。

它适用于谁

希望在低端通用计算机或爱好者 GPU 上运行最先进的、巨大的开源 LLMs,同时避免通常与大量量化相关的精度损失的开发者和研究者。

亮点

  • 极致的 VRAM 效率:在 8GB VRAM 上运行 405B Llama 3.1,或在 12GB VRAM 上运行 DeepSeek-V3(671B)。
  • 广泛的模型支持:支持 Llama (2/3/3.1/3.3/4)、Qwen、DeepSeek、Mistral、Mixtral、Phi、Gemma、ChatGLM 等。
  • 无需量化选项:能够在不进行剪枝或蒸馏的情况下以全精度运行模型。
  • 跨平台:支持 Linux 和 Apple Silicon (MacOS)。
  • 为简单而编码:使用单一的 AutoModel 类自动检测并从 Hugging Face 加载模型。

摘要: AirLLM 是一个库,通过一次只将一层模型加载到 VRAM 中,使得在低端 GPU 上运行巨大的 LLMs(多达 671B 参数)成为可能。

标题: airllm: 一种内存高效的推理引擎,通过一次加载一层的方式在消费级 GPU 上运行巨大的 LLMs

Sources