Neroued/ninfer

High-performance single-GPU inference for selected model checkpoints and GPUs.

解決的問題

NInfer 是一款專為單一 NVIDIA GeForce RTX 5090 上特定 Qwen 模型檢查點設計的高性能推理引擎。透過消除通用執行環境的額外負荷,實現對文字、影像與影片提示的最大單 GPU 性能。

工作原理

NInfer 從零開始以 C++/CUDA 建構,使用專用的工件(.ninfer 檔案)而非標準的 Transformers 檢查點。它利用硬體特定優化,例如 W4A4 Tensor Core MMA 用於預填入,以及在 NVFP4 設定中使用 A16 NVFP4 核心用於解碼。該引擎支援分塊預填入、CUDA Graph 解碼與推測解碼(MTP 與 DFlash),以加速生成過程。

適用對象

需要在本地對 Qwen 3.6 與 3.8 模型實現最高吞吐量與最低延遲的 NVIDIA RTX 5090 使用者,包括開發者與研究人員。

主要亮點

  • 硬體優化:專為 RTX 5090(sm_120a)與 CUDA 13.1 調校。
  • 多模態支援:支援文字、多圖像與影片輸入。
  • 推測解碼:實作 MTP(多標記預測)與 DFlash(適用於 35B-A3B 目標)以提升解碼速度。
  • API 兼容:提供與 OpenAI 與 Anthropic 消息格式相容的本地 CLI 與 HTTP 伺服器。
  • 高吞吐量:在特定模型設定下,可達每秒超過 1,300 個聚合解碼標記。
  • 記憶體管理:支援 BF16 與 INT8 分組 64 KV 快取,容量可設定。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案