InternLM/lmdeploy

LMDeploy is a toolkit for compressing, deploying, and serving LLMs.

What it solves

LMDeploy は、LLM および VLM の圧縮、デプロイ、およびサービングのプロセスを簡化・加速化するためのツールキットです。高性能な推論エンジンと量子化技術を提供することで、スループットを向上させ、メモリ使用量を削減し、 LLM 推論における高コスト・低遅延の課題を解決します。

How it works

本プロジェクトは、2 つの異なる推論エンジンを提供します:

  • TurboMind: 究極の性能最適化に焦点を当て、persistent batching (continuous batching)、blocked KV cache、tensor parallelism、および高性能な CUDA kernels を活用しています。
  • PyTorch Engine: Python ベースのエンジンで、開発者のハードルを低くし、新しい機能の迅速な実験を可能にします。

また、モデルのサイズを縮小し推論を高速化するために、効果的な量子化 (weight-only および KV cache 量子化) を実装しており、モデルを複数台の機械や GPU に分散してデプロイするためのリクエスト・ディストリビューション・サービスも含まれています。

Who it’s for

このツールキットは、高いリクエスト・スループットと低遅延が不可欠な本番環境で LLM または VLM をデプロイする開発者や AI エンジニア、および新しいモデルを迅速に実験したい研究者向けです。

Highlights

  • High Throughput: 特定のシナリオでは、vLLM より最大 1.8x 高いリクエスト・スループットを実現します。
  • Broad Model Support: 幅広い LLM (例: Llama 3.1, Qwen, DeepSeek, Mistral) および VLM (例: InternVL, Qwen-VL, LLaVA) をサポートします。
  • Advanced Quantization: 4-bit 推論と AWQ をサポートし、FP16 と比較して最大 2.4x 高速化を実現します。
  • Flexible Deployment: プロキシサーバーを介して、マルチモデル、マルチマシン、マルチカード推論サービスをサポートします。
  • Hardware Compatibility: NVIDIA GPU と Huawei Ascend プラットフォームをサポートします。