InternLM/lmdeploy

LMDeploy is a toolkit for compressing, deploying, and serving LLMs.

解决的问题

LMDeploy 是一个旨在简化并加速大语言模型(LLMs)和视觉语言模型(VLMs)压缩、部署和推理的工具包。它通过提供高性能引擎和量化技术,解决了 LLM 推理中高计算成本和高延迟的挑战。

工作原理

该项目提供两种不同的推理引擎:

  • TurboMind:专注于极致性能优化,利用持续批处理(连续批处理)、分块 KV 缓存、张量并行以及高性能 CUDA 内核等特性。
  • PyTorch Engine:基于 Python 的引擎,旨在降低开发门槛,支持对新功能的快速实验。

同时集成了量化方法(如 AWQ 和 KV 缓存量化),以减小模型大小和内存占用,并提供请求分发服务,用于管理跨多台机器和 GPU 的多模型部署。

适用人群

  • 机器学习工程师和 DevOps:希望在生产环境中以高吞吐量和低延迟部署 LLM/VLM 的用户。
  • AI 研究人员:需要灵活引擎以快速实验新模型架构的开发者。
  • 企业用户:需要在多 GPU 和多台机器上扩展 LLM 服务的组织。

核心亮点

  • 高吞吐量:在某些场景下,请求吞吐量比 vLLM 高达 1.8 倍。
  • 广泛模型支持:兼容大量模型,包括 Llama、Qwen、InternLM、DeepSeek、Mistral 和 Phi。
  • 多模态能力:全面支持视觉语言模型(VLMs),包括 InternVL 和 LLaVA。
  • 高效量化:支持 4 位权重仅量化和 KV 量化,相比 FP16 显著提升推理速度。
  • 灵活部署:支持多模型、多机器、多卡推理服务。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目