Neroued/ninfer
High-performance single-GPU inference for selected model checkpoints and GPUs.
解決的問題
NInfer 是一款專為單一 NVIDIA GeForce RTX 5090 上特定 Qwen 模型檢查點設計的高性能推理引擎。透過消除通用執行環境的額外負荷,實現對文字、影像與影片提示的最大單 GPU 性能。
工作原理
NInfer 從零開始以 C++/CUDA 建構,使用專用的工件(.ninfer 檔案)而非標準的 Transformers 檢查點。它利用硬體特定優化,例如 W4A4 Tensor Core MMA 用於預填入,以及在 NVFP4 設定中使用 A16 NVFP4 核心用於解碼。該引擎支援分塊預填入、CUDA Graph 解碼與推測解碼(MTP 與 DFlash),以加速生成過程。
適用對象
需要在本地對 Qwen 3.6 與 3.8 模型實現最高吞吐量與最低延遲的 NVIDIA RTX 5090 使用者,包括開發者與研究人員。
主要亮點
- 硬體優化:專為 RTX 5090(
sm_120a)與 CUDA 13.1 調校。 - 多模態支援:支援文字、多圖像與影片輸入。
- 推測解碼:實作 MTP(多標記預測)與 DFlash(適用於 35B-A3B 目標)以提升解碼速度。
- API 兼容:提供與 OpenAI 與 Anthropic 消息格式相容的本地 CLI 與 HTTP 伺服器。
- 高吞吐量:在特定模型設定下,可達每秒超過 1,300 個聚合解碼標記。
- 記憶體管理:支援 BF16 與 INT8 分組 64 KV 快取,容量可設定。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案