Neroued/ninfer
High-performance single-GPU inference for selected model checkpoints and GPUs.
解决的问题
NInfer 是一款专为单个 NVIDIA GeForce RTX 5090 上特定 Qwen 模型检查点设计的高性能推理引擎。通过消除通用运行时的开销,实现对文本、图像和视频提示的最大单 GPU 性能。
工作原理
NInfer 从零开始使用 C++/CUDA 构建,采用专用的工件(.ninfer 文件)而非标准的 Transformers 检查点。它利用硬件特定优化,例如 W4A4 Tensor Core MMA 用于预填充,以及在 NVFP4 配置中使用 A16 NVFP4 内核用于解码。该引擎支持分块预填充、CUDA Graph 解码和推测解码(MTP 和 DFlash),以加速生成过程。
适用人群
需要在本地对 Qwen 3.6 和 3.8 模型实现最高吞吐量和最低延迟的 NVIDIA RTX 5090 用户,包括开发者和研究人员。
主要亮点
- 硬件优化:专为 RTX 5090(
sm_120a)和 CUDA 13.1 进行调优。 - 多模态支持:支持文本、多图像和视频输入。
- 推测解码:实现 MTP(多标记预测)和 DFlash(用于 35B-A3B 目标)以提升解码速度。
- API 兼容:提供与 OpenAI 和 Anthropic 消息格式兼容的本地 CLI 和 HTTP 服务器。
- 高吞吐量:在特定模型配置下,可达到每秒超过 1,300 个聚合解码标记。
- 内存管理:支持 BF16 和 INT8 分组 64 KV 缓存,容量可配置。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目