1CatAI/1Cat-vLLM
V100 / SM70-focused vLLM engineering fork for modern LLM inference.
解决的问题
1Cat-vLLM 是一个专为防止 Tesla V100 (SM70) GPU 在现代大语言模型时代过时而设计的 vLLM 特化分支。它针对旧的 Volta 架构硬件优化了现代模型(特别是 Qwen 类型的 AWQ 和实验性 FP8 模型)的推理服务,而标准 vLLM 在这些硬件上可能效率较低或兼容性较差。
如何工作
该项目集成了多项硬件特定优化,以在 V100 上实现高性能推理:
- 自定义内核:整合了源自 TurboMind 的 SM70 内核以及用于解码和预填充操作的专用
FLASH_ATTN_V100后端。 - AWQ 支持:为 SM70 上的密集型和 MoE Qwen 模型提供优化的 4 位 AWQ 推理路径。
- 内存与上下文管理:包含针对长上下文服务(最高达 256K 上下文)优化的运行时默认值,并管理多模态输入的内存预算。
- 推测性解码:作为特定工作负载的可选路径,支持 MTP(多标记预测)推测性解码。
- 实验性路径:包含对 FP8 模型、FP8 KV 缓存和 DFlash 的研究级支持。
适用人群
本项目适用于仍在使用 Tesla V100 GPU 的个人开发者、工作室和团队,希望部署具备 OpenAI 兼容 API 的现代高性能 LLM。
主要亮点
- V100 优先优化:专门针对 SM70 架构优化,而非通用分支。
- 长上下文能力:在内存允许的情况下,公开配置默认支持 256K 上下文。
- 多模态就绪:在 SM70 路径上默认支持图像输入。
- OpenAI 兼容性:已通过 Cherry Studio 和 OpenClaw 等常见 OpenAI 风格客户端验证。
- 预构建轮子:提供 Ubuntu 24.04 和 CUDA 12.8 的预构建轮子,安装简便。
相关
- 项目
- 项目
- Dispatch
- 项目
- Dispatch