airllm: 1レイヤーずつロードすることでコンシューマーGPU上で巨大なLLMを実行するメモリ効率の高い推論エンジン

airllm: コンシューマーGPU上で1レイヤーずつロードすることで巨大なLLMを実行するメモリ効率の高い推論エンジン

何を解決するか

AirLLMは、非常に限られたVRAMしかないコンシューマーグレードのハードウェアでも、巨大な大規模言語モデル(LLM)を実行できるようにします。これにより、12GB程度のVRAMしかないGPUでも671Bパラメータ(例えばDeepSeek-V3)のモデル、または4GBのカードでも70Bモデルを、量子化、蒸留、剪定を必要とせずに実行できます。

どうやって動作するか

GPUメモリにモデル全体をロードする代わりに、AirLLMはモデルを分解し、レイヤーごとに保存します。推論中は、GPU上にモデルの1レイヤーのみを常に保持するため、VRAMの必要量はモデル全体のサイズではなく、単一レイヤーのサイズによって決まります。さらに、オプションのブロックごとの量子化(4ビットまたは8ビット)をサポートしており、ディスク上のウェイトサイズを削減し、ロード時間を最大3倍まで高速化できます。

誰のためのものか

状態の芸術的(最先端)かつ巨大なオープンソースLLMを、量子化による精度低下を伴わずに、低スペックの汎用コンピュータや趣味のGPUで実行したい開発者および研究者向けです。

ハイライト

  • Extreme VRAM Efficiency: 8GB VRAMで405B Llama 3.1を実行、または12GB VRAMでDeepSeek-V3 (671B)を実行。
  • Broad Model Support: Llama (2/3/3.1/3.3/4), Qwen, DeepSeek, Mistral, Mixtral, Phi, Gemma, ChatGLM などに対応。
  • No-Quantization Option: プルーニングや蒸留を必要とせず、フル精度でモデルを実行できる機能。
  • Cross-Platform: LinuxおよびApple Silicon (MacOS)をサポート。
  • Coded for Simplicity: 単一の AutoModel クラスを使用して、Hugging Face からモデルを自動的に検出およびロードします。

Sources