lyogavin/airllm

AirLLM 70B inference with single 4GB GPU

何を解決するか

AirLLM は、非常に限られた VRAM を持つコンシューマー向けハードウェアで巨大な大規模言語モデル(LLM)を実行できるようにします。大規模モデル(例:Llama 3.1 405B や DeepSeek-V3 671B)を 4GB から 12GB のメモリを持つ単一の GPU に収めるために、量子化、蒸留、または削減の必要を排除します。

動作方法

AirLLM は、モデル全体を GPU メモリにロードするのではなく、モデルを分解してレイヤー単位でストリーミングします。1つのレイヤーだけを GPU 上に保持することで、VRAM の要件はモデル全体のサイズではなく、1つのレイヤーのサイズによって決まります。スパースな Mixtral オブ エキスパート(MoE)モデルの場合、トークンが実際にルーティングされるエキスパートのみをストリーミングすることで、さらに最適化されます。

対象ユーザー

低スペックのコンシューマー機や単一の趣味用 GPU カードで、最新の高パラメータ LLM を精度を損なうことなく実行したい開発者や研究者。

主な特徴

  • 極めて高いメモリ効率:4GB VRAM で 70B モデル、約 12GB VRAM で 671B モデルを実行可能。
  • 広範なモデル対応:Llama、Qwen、DeepSeek、Mistral、Mixtral、Phi、Gemma、Kimi K3 に対応。
  • 広範なハードウェア対応:Linux、Windows、Apple Silicon(macOS)で動作可能。
  • オプションによる高速化:ブロック単位の量子化(4ビットまたは 8ビット)をサポートし、ディスク読み込みのボトルネックを軽減し、推論速度を最大 3 倍に向上可能。
  • 簡単な統合:Hugging Face transformers API に似た AutoModel クラスを提供し、導入が容易。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト