MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark

Qwen3.8-Flash-Next on ONE DGX Spark (TP=1)

해결하는 문제

이 프로젝트는 단일 DGX Spark 머신에서 Mia-AiLab/Qwen3.8-Flash-Next-NVFP4 시각-언어 모델을 배포하기 위한 자체 포함형 레시피와 배포 스크립트를 제공합니다. 특히 99 GiB 크기의 체크포인트를 머신의 유니파이드 메모리에 맞추되, 텍스트, 이미지, 비디오 처리에 대해 높은 성능을 유지하는 문제를 해결합니다.

작동 방식

시스템은 vLLM을 추론 엔진으로 사용하며, PLE 테이블을 오프로드하고 메모리 매핑하여 메모리 사용을 최적화합니다. 다음과 같은 성능 최적화 기법을 적용합니다:

  • 예측 디코딩: 어휘 수를 줄인 드래프터와 MTP(Multi-Token Prediction)을 사용하여 디코딩 속도를 향상.
  • 메모리 관리: 시스템 불안정성과 메모리 누수를 방지하기 위해 호스트 측 메모리 제한(HOST_RESERVE_GIB)을 구현.
  • KV 캐시 최적화: FP8 KV 캐시를 지원하여 메모리에 저장 가능한 토큰 수를 증가.
  • 다중 모달 지원: 27층의 비전 타워를 통합하여 OpenAI 호환 API 구조를 사용해 이미지 및 비디오를 즉시 처리 가능.

대상 사용자

DGX Spark 하드웨어에 접근이 가능한 개발자 및 연구자로, 최소한의 설정 오버헤드로 고성능 다중 모달 시각-언어 모델을 배포하고자 하는 분들.

주요 특징

  • 다중 모달 기능: 텍스트, 이미지, 비디오(시간 순서 인식 검증 완료)에 대한 네이티브 지원.
  • 고스루풋: 특정 구성에서 8개 스트림에서 총 162.9 토큰/초를 달성.
  • 최적화된 프리필: PLE 페이지 폴트 프리페치 메커니즘을 포함하여 최초 토큰까지의 시간(TTFT)을 단축.
  • 유연한 구성: 환경 변수를 통해 컨텍스트 길이, 예측 깊이, 메모리 예산을 쉽게 조정 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트