airllm: 1レイヤーずつロードすることで、コンシューマー向けGPUで巨大なLLMを実行するメモリ効率の高い推論エンジン

何を解決するか

AirLLMを使用すると、VRAMが非常に限られているコンシューマー向けハードウェアで、巨大な大規模言語モデル(LLM)を実行できます。量子化、蒸留、または枝刈りを必要とせずに、12GBのVRAMを持つGPUで671Bパラメータ(DeepSeek-V3など)もの巨大なモデルを実行したり、4GBのカードで70Bモデルを実行したりすることが可能です。

仕組み

モデル全体をGPUメモリにロードする代わりに、AirLLMはモデルを分解してレイヤーごとに保存します。推論中、一度にモデルの1レイヤーのみをGPU上に保持するため、VRAMの要件はモデルの総サイズではなく、単一レイヤーのサイズによって決まります。また、オプションでブロック単位の量子化(4-bitまたは8-bit)をサポートしており、ディスク上の重みのサイズを削減し、ロード時間を最大3倍高速化できます。

対象者

重い量子化に伴う典型的な精度低下を伴わずに、低スペックな汎用コンピュータやホビー向けGPUで、最先端の巨大なオープンソースLLMを実行したい開発者や研究者。

ハイライト

  • 極限のVRAM効率: 8GBのVRAMで405B Llama 3.1を実行、または12GBのVRAMでDeepSeek-V3 (671B)を実行。
  • 幅広いモデルサポート: Llama (2/3/3.1/3.3/4)、Qwen、DeepSeek、Mistral、Mixtral、Phi、Gemma、ChatGLM、その他に対応。
  • 量子化なしのオプション: 枝刈りや蒸留を必要とせずに、モデルをフル精度で実行する機能。
  • クロスプラットフォーム: LinuxおよびApple Silicon (MacOS) をサポート。
  • シンプルに設計されたコード: 単一の AutoModel クラスを使用して、Hugging Faceからモデルを自動的に検出してロードします。

Sources