Neroued/ninfer

High-performance single-GPU inference for selected model checkpoints and GPUs.

何を解決するか

NInfer は、単一の NVIDIA GeForce RTX 5090 上で特定の Qwen モデル チェックポイント向けに最適化された高性能推論エンジンです。汎用ランタイムのオーバーヘッドを排除することで、テキスト、画像、動画のプロンプトに対して最大の単一GPU性能を実現します。

動作方法

C++/CUDA で完全に新規に構築された NInfer は、標準の Transformers チェックポイントではなく、専用のアーティファクト(.ninfer ファイル)を使用します。sm_120a 構成の RTX 5090 に特化したハードウェア最適化(W4A4 Tensor Core MMA によるプレフィル、NVFP4 プロファイルでの A16 NVFP4 カーネル)を活用しています。エンジンはチャンク化されたプレフィル、CUDA Graph デコード、および予測デコード(MTP および DFlash)をサポートし、生成を高速化します。

対象ユーザー

Qwen 3.6 および 3.8 モデルのローカル推論において、絶対的な最高スループットと最低レイテンシを必要とする、NVIDIA RTX 5090 を搭載した開発者および研究者です。

主な特徴

  • ハードウェア最適化: RTX 5090(sm_120a)および CUDA 13.1 に特化して調整済み。
  • マルチモーダル対応: テキスト、複数画像、動画入力を処理可能。
  • 予測デコード: MTP(マルチトークン予測)および DFlash(35B-A3B ターゲット用)を実装し、デコード速度を向上。
  • API互換性: OpenAI および Anthropic のメッセージフォーマットと互換性のあるローカル CLI および HTTP サーバーを提供。
  • 高スループット: 特定のモデルプロファイルで、1秒あたり1,300トークン以上の合計デコード速度を達成可能。
  • メモリ管理: BF16 および INT8 グループ64 KVキャッシュをサポートし、容量を設定可能。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト