Neroued/ninfer

High-performance single-GPU inference for selected model checkpoints and GPUs.

해결하는 문제

NInfer는 단일 NVIDIA GeForce RTX 5090에서 특정 Qwen 모델 체크포인트를 위한 고성능 추론 엔진입니다. 일반적인 런타임의 오버헤드를 제거하여 텍스트, 이미지, 비디오 프롬프트에 대해 최대의 단일 GPU 성능을 달성합니다.

작동 방식

C++/CUDA로 완전히 새로 구현된 NInfer는 표준 Transformers 체크포인트 대신 전용 아티팩트(.ninfer 파일)를 사용합니다. sm_120a 구성의 RTX 5090에 특화된 하드웨어 최적화(예: W4A4 Tensor Core MMA를 통한 프리필, NVFP4 프로파일에서 A16 NVFP4 커널)를 활용합니다. 엔진은 청크 기반 프리필, CUDA Graph 디코드, 그리고 예측 디코드(MTP 및 DFlash)를 지원하여 생성 속도를 가속화합니다.

대상 사용자

Qwen 3.6 및 3.8 모델의 로컬에서 최고의 처리량과 최저 지연을 필요로 하는 NVIDIA RTX 5090 사용자인 개발자 및 연구자입니다.

주요 특징

  • 하드웨어 최적화: RTX 5090(sm_120a) 및 CUDA 13.1에 특화되어 있습니다.
  • 다중 모달 지원: 텍스트, 다중 이미지, 비디오 입력을 처리합니다.
  • 예측 디코드: MTP(다중 토큰 예측) 및 DFlash(35B-A3B 타겟용)를 구현하여 디코드 속도를 향상시킵니다.
  • API 호환성: OpenAI 및 Anthropic 메시지 형식과 호환되는 로컬 CLI 및 HTTP 서버를 제공합니다.
  • 고처리량: 특정 모델 프로파일에서 1초당 1,300개 이상의 총 디코드 토큰을 달성할 수 있습니다.
  • 메모리 관리: BF16 및 INT8 그룹 64 KV 캐시를 지원하며, 용량을 구성 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트