InternLM/lmdeploy

LMDeploy is a toolkit for compressing, deploying, and serving LLMs.

解決的問題

LMDeploy 是一個專為簡化並加速大語言模型(LLMs)與視覺語言模型(VLMs)壓縮、部署與服務而設計的工具包。它透過提供高效率的引擎與量化技術,解決 LLM 推論中高計算成本與高延遲的挑戰。

作法原理

本專案提供兩種不同的推理引擎:

  • TurboMind:專注於極致的效能優化,利用持續批次(連續批次)、分塊 KV 快取、張量平行運算,以及高效率 CUDA 核心等特性。
  • PyTorch Engine:基於 Python 的引擎,旨在降低開發門檻,並支援對新功能的快速實驗。

同時整合了量化方法(如 AWQ 與 KV 快取量化),以減少模型大小與記憶體佔用,並提供請求分發服務,用於管理跨多台機器與 GPU 的多模型部署。

適用對象

  • 機器學習工程師與 DevOps:希望在生產環境中以高吞吐量與低延遲部署 LLM/VLM 的使用者。
  • AI 研究人員:需要彈性引擎以快速實驗新模型架構的開發者。
  • 企業使用者:需要在多 GPU 與多台機器上擴展 LLM 服務的組織。

主要特色

  • 高吞吐量:在某些情境下,請求吞吐量可達 vLLM 的 1.8 倍。
  • 廣泛模型支援:相容大量模型,包括 Llama、Qwen、InternLM、DeepSeek、Mistral 與 Phi。
  • 多模態能力:完整支援視覺語言模型(VLMs),包含 InternVL 與 LLaVA。
  • 高效量化:支援 4 位元權重僅量化與 KV 量化,相比 FP16 显著提升推論速度。
  • 彈性部署:支援多模型、多機器、多卡推理服務。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案