Neroued/ninfer
High-performance single-GPU inference for selected model checkpoints and GPUs.
何を解決するか
NInfer は、単一の NVIDIA GeForce RTX 5090 上で特定の Qwen モデル チェックポイント向けに最適化された高性能推論エンジンです。汎用ランタイムのオーバーヘッドを排除することで、テキスト、画像、動画のプロンプトに対して最大の単一GPU性能を実現します。
動作方法
C++/CUDA で完全に新規に構築された NInfer は、標準の Transformers チェックポイントではなく、専用のアーティファクト(.ninfer ファイル)を使用します。sm_120a 構成の RTX 5090 に特化したハードウェア最適化(W4A4 Tensor Core MMA によるプレフィル、NVFP4 プロファイルでの A16 NVFP4 カーネル)を活用しています。エンジンはチャンク化されたプレフィル、CUDA Graph デコード、および予測デコード(MTP および DFlash)をサポートし、生成を高速化します。
対象ユーザー
Qwen 3.6 および 3.8 モデルのローカル推論において、絶対的な最高スループットと最低レイテンシを必要とする、NVIDIA RTX 5090 を搭載した開発者および研究者です。
主な特徴
- ハードウェア最適化: RTX 5090(
sm_120a)および CUDA 13.1 に特化して調整済み。 - マルチモーダル対応: テキスト、複数画像、動画入力を処理可能。
- 予測デコード: MTP(マルチトークン予測)および DFlash(35B-A3B ターゲット用)を実装し、デコード速度を向上。
- API互換性: OpenAI および Anthropic のメッセージフォーマットと互換性のあるローカル CLI および HTTP サーバーを提供。
- 高スループット: 特定のモデルプロファイルで、1秒あたり1,300トークン以上の合計デコード速度を達成可能。
- メモリ管理: BF16 および INT8 グループ64 KVキャッシュをサポートし、容量を設定可能。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト