1CatAI/1Cat-vLLM
V100 / SM70-focused vLLM engineering fork for modern LLM inference.
解決的問題
1Cat-vLLM 是專為防止 Tesla V100 (SM70) GPU 在現代大型語言模型時代被淘汰而設計的 vLLM 特化分支。它針對舊的 Volta 架構硬體優化了現代模型(特別是 Qwen 類型的 AWQ 和實驗性 FP8 模型)的推理服務,而標準 vLLM 在這些硬體上可能效率較低或相容性不佳。
如何運作
該項目整合了多項硬體特定優化,以在 V100 上實現高效率推理:
- 自訂內核:整合了源自 TurboMind 的 SM70 內核以及用於解碼和預填操作的專用
FLASH_ATTN_V100後端。 - AWQ 支援:為 SM70 上的密集型與 MoE Qwen 模型提供優化的 4 位 AWQ 推理路徑。
- 記憶體與上下文管理:包含針對長上下文服務(最高達 256K 上下文)優化之執行時預設值,並管理多模態輸入的記憶體預算。
- 推測性解碼:作為特定工作負載的可選路徑,支援 MTP(多標記預測)推測性解碼。
- 實驗性路徑:包含對 FP8 模型、FP8 KV 快取與 DFlash 的研究級支援。
適用對象
本項目適用於持續使用 Tesla V100 GPU 的個人開發者、工作室與團隊,希望部署具備 OpenAI 兼容 API 的現代高效率 LLM。
主要亮點
- V100 優先優化:專為 SM70 架構優化,而非通用分支。
- 長上下文能力:在記憶體允許的情況下,公開設定預設支援 256K 上下文。
- 多模態就緒:在 SM70 路徑上預設支援影像輸入。
- OpenAI 相容性:已透過 Cherry Studio 與 OpenClaw 等常見 OpenAI 風格客戶端驗證。
- 預建輪子:提供 Ubuntu 24.04 與 CUDA 12.8 的預建輪子,安裝輕鬆。
相關
- 專案
- 專案
- Dispatch
- 專案
- Dispatch