1CatAI/1Cat-vLLM

V100 / SM70-focused vLLM engineering fork for modern LLM inference.

解决的问题

1Cat-vLLM 是一个专为防止 Tesla V100 (SM70) GPU 在现代大语言模型时代过时而设计的 vLLM 特化分支。它针对旧的 Volta 架构硬件优化了现代模型(特别是 Qwen 类型的 AWQ 和实验性 FP8 模型)的推理服务,而标准 vLLM 在这些硬件上可能效率较低或兼容性较差。

如何工作

该项目集成了多项硬件特定优化,以在 V100 上实现高性能推理:

  • 自定义内核:整合了源自 TurboMind 的 SM70 内核以及用于解码和预填充操作的专用 FLASH_ATTN_V100 后端。
  • AWQ 支持:为 SM70 上的密集型和 MoE Qwen 模型提供优化的 4 位 AWQ 推理路径。
  • 内存与上下文管理:包含针对长上下文服务(最高达 256K 上下文)优化的运行时默认值,并管理多模态输入的内存预算。
  • 推测性解码:作为特定工作负载的可选路径,支持 MTP(多标记预测)推测性解码。
  • 实验性路径:包含对 FP8 模型、FP8 KV 缓存和 DFlash 的研究级支持。

适用人群

本项目适用于仍在使用 Tesla V100 GPU 的个人开发者、工作室和团队,希望部署具备 OpenAI 兼容 API 的现代高性能 LLM。

主要亮点

  • V100 优先优化:专门针对 SM70 架构优化,而非通用分支。
  • 长上下文能力:在内存允许的情况下,公开配置默认支持 256K 上下文。
  • 多模态就绪:在 SM70 路径上默认支持图像输入。
  • OpenAI 兼容性:已通过 Cherry Studio 和 OpenClaw 等常见 OpenAI 风格客户端验证。
  • 预构建轮子:提供 Ubuntu 24.04 和 CUDA 12.8 的预构建轮子,安装简便。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • Dispatch