tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark

DeepSeek V4 Flash DSpark 1M NVFP4 KV recipe for 2x DGX Spark

해결하는 문제

이 프로젝트는 2노드 DGX Spark 클러스터에서 DeepSeek-V4-Flash-Vision-Exp 멀티모달 모델의 고성능 배포 레시피를 제공합니다. 이 모델에 대한 실용적인 서빙 엔진이 부족한 문제를 해결하며, vLLM 내에서 네이티브 이미지 입력과 사전 추론(decode)를 가능하게 하기 위해 필요한 포트 및 패치를 제공합니다.

작동 방식

이 프로젝트는 vLLM을 서빙 엔진으로 사용하며, 두 노드 간에 텐서 병렬(TP=2)로 구성됩니다. 성능 최적화를 위해 다음과 같은 핵심 구성 요소를 활용합니다:

  • DSpark 사전 추론: 드래프트 모델을 사용해 한 스텝당 여러 토큰을 예측하여 처리량을 크게 향상시킵니다.
  • NVFP4 KV 캐시: 실험적인 nvfp4_ds_mla KV 캐시를 도입하여 엄청난 1M 토큰의 컨텍스트 창을 지원합니다.
  • 사용자 정의 바인드 마운트: 모델의 비전 아키텍처가 표준 vLLM 클래스에서 네이티브로 지원되지 않기 때문에, 읽기 전용 바인드 마운트를 사용해 필요한 비전 모델 파일(ds4v_model.py 등)과 핵심 버그 수정(Patch 3 및 Patch 4)을 런타임 환경에 직접 삽입합니다.

대상 사용자

DGX Spark 하드웨어에 접근이 가능한 ML 엔지니어 및 연구자로서, 높은 처리량, 대규모 컨텍스트 창, 네이티브 비전 기능을 갖춘 DeepSeek-V4-Flash-Vision-Exp 모델을 배포하고자 하는 분들.

주요 특징

  • 네이티브 비전 지원: 32블록 ViT와 어라이너의 진정한 포트를 구현하여 VLM 프록시를 회피합니다.
  • 거대한 컨텍스트: 최대 1,048,576 토큰까지 조정된 컨텍스트를 지원합니다.
  • 사전 추론 가속: DSpark를 k=5 드래프트 길이로 설정하여 특정 워크로드에서 80.1 tok/s의 높은 토큰/초 속도를 달성합니다.
  • 핵심 버그 수정: DSpark 드래프트 공유 전문가 로더의 침묵적 실패를 수정하는 Patch 4를 포함하여, 디코딩 속도가 절반으로 떨어지는 문제를 방지합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트