lyogavin/airllm

AirLLM 70B inference with single 4GB GPU

解决的问题

AirLLM 允许用户在 VRAM 极其有限的消费级硬件上运行巨大的大语言模型(LLM)。它无需量化、蒸馏或剪枝,即可将超大模型(如 Llama 3.1 405B 或 DeepSeek-V3 671B)部署到仅拥有 4GB 到 12GB 内存的单个 GPU 上。

工作原理

AirLLM 不会将整个模型加载到 GPU 内存中,而是将模型分解并逐层流式传输。通过每次仅在 GPU 上保留一层,VRAM 的需求由单层大小决定,而非整个模型的大小。对于稀疏的混合专家(MoE)模型,它进一步优化,仅流式传输实际被 token 路由到的专家。

适用人群

希望在低性能通用计算机或单个爱好者级 GPU 卡上运行前沿高参数 LLM,且不牺牲模型精度的开发者和研究人员。

主要亮点

  • 极致内存效率:可在 4GB VRAM 上运行 70B 模型,在约 12GB VRAM 上运行 671B 模型。
  • 广泛模型支持:兼容 Llama、Qwen、DeepSeek、Mistral、Mixtral、Phi、Gemma 和 Kimi K3。
  • 广泛硬件支持:支持 Linux、Windows 和 Apple Silicon(macOS)。
  • 可选加速:支持按块量化(4 位或 8 位),可减少磁盘加载瓶颈,将推理速度提升最高达 3 倍。
  • 简单集成:使用与 Hugging Face transformers API 类似的 AutoModel 类,便于快速采用。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目