InternLM/lmdeploy
LMDeploy is a toolkit for compressing, deploying, and serving LLMs.
解決的問題
LMDeploy 是一個專為簡化並加速大語言模型(LLMs)與視覺語言模型(VLMs)壓縮、部署與服務而設計的工具包。它透過提供高效率的引擎與量化技術,解決 LLM 推論中高計算成本與高延遲的挑戰。
作法原理
本專案提供兩種不同的推理引擎:
- TurboMind:專注於極致的效能優化,利用持續批次(連續批次)、分塊 KV 快取、張量平行運算,以及高效率 CUDA 核心等特性。
- PyTorch Engine:基於 Python 的引擎,旨在降低開發門檻,並支援對新功能的快速實驗。
同時整合了量化方法(如 AWQ 與 KV 快取量化),以減少模型大小與記憶體佔用,並提供請求分發服務,用於管理跨多台機器與 GPU 的多模型部署。
適用對象
- 機器學習工程師與 DevOps:希望在生產環境中以高吞吐量與低延遲部署 LLM/VLM 的使用者。
- AI 研究人員:需要彈性引擎以快速實驗新模型架構的開發者。
- 企業使用者:需要在多 GPU 與多台機器上擴展 LLM 服務的組織。
主要特色
- 高吞吐量:在某些情境下,請求吞吐量可達 vLLM 的 1.8 倍。
- 廣泛模型支援:相容大量模型,包括 Llama、Qwen、InternLM、DeepSeek、Mistral 與 Phi。
- 多模態能力:完整支援視覺語言模型(VLMs),包含 InternVL 與 LLaVA。
- 高效量化:支援 4 位元權重僅量化與 KV 量化,相比 FP16 显著提升推論速度。
- 彈性部署:支援多模型、多機器、多卡推理服務。
相關
- 專案
- 專案
- 專案
- 專案
- 專案