InternLM/lmdeploy
LMDeploy is a toolkit for compressing, deploying, and serving LLMs.
What it solves
LMDeploy は、LLM および VLM の圧縮、デプロイ、およびサービングのプロセスを簡化・加速化するためのツールキットです。高性能な推論エンジンと量子化技術を提供することで、スループットを向上させ、メモリ使用量を削減し、 LLM 推論における高コスト・低遅延の課題を解決します。
How it works
本プロジェクトは、2 つの異なる推論エンジンを提供します:
- TurboMind: 究極の性能最適化に焦点を当て、persistent batching (continuous batching)、blocked KV cache、tensor parallelism、および高性能な CUDA kernels を活用しています。
- PyTorch Engine: Python ベースのエンジンで、開発者のハードルを低くし、新しい機能の迅速な実験を可能にします。
また、モデルのサイズを縮小し推論を高速化するために、効果的な量子化 (weight-only および KV cache 量子化) を実装しており、モデルを複数台の機械や GPU に分散してデプロイするためのリクエスト・ディストリビューション・サービスも含まれています。
Who it’s for
このツールキットは、高いリクエスト・スループットと低遅延が不可欠な本番環境で LLM または VLM をデプロイする開発者や AI エンジニア、および新しいモデルを迅速に実験したい研究者向けです。
Highlights
- High Throughput: 特定のシナリオでは、vLLM より最大 1.8x 高いリクエスト・スループットを実現します。
- Broad Model Support: 幅広い LLM (例: Llama 3.1, Qwen, DeepSeek, Mistral) および VLM (例: InternVL, Qwen-VL, LLaVA) をサポートします。
- Advanced Quantization: 4-bit 推論と AWQ をサポートし、FP16 と比較して最大 2.4x 高速化を実現します。
- Flexible Deployment: プロキシサーバーを介して、マルチモデル、マルチマシン、マルチカード推論サービスをサポートします。
- Hardware Compatibility: NVIDIA GPU と Huawei Ascend プラットフォームをサポートします。