MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

DeepSeek v4 Flash EXL3 on one DGX Spark

해결하는 문제

이 프로젝트는 NVIDIA DGX Spark 하드웨어에서 DeepSeek V4 Flash 0731 모델의 고성능 단일 노드 배포를 위한 런처를 제공합니다. 일반적으로 공식 FP4 빌드에 필요로 하는 다중 노드 설정(텐서 병렬 2)이 필요 없으며, 하나의 장치에서 높은 처리량과 거대한 컨텍스트 창을 지원합니다.

작동 방식

이 프로젝트는 128 GiB의 통합 메모리를 갖춘 NVIDIA DGX Spark(GB10, SM121)에 최적화된 Docker 기반 레시피를 사용합니다. sparkinfer 커널 스택과 EXL3 양자화(3.0 bpw)를 활용해 모델을 하나의 노드에 맞춥니다. 성능을 최적화하기 위해 K64 드래프트 모델을 사용하는 DSpark K5 예측 디코딩을 구현하고, nvfp4_ds_mla 압축 KV 캐시를 사용합니다. 또한 CUDA 그래프 캡처를 통해 병렬 디코딩이 최적화된 그래프에서 실행되도록 하여 즉각 실행(eager execution)으로 돌아가지 않도록 합니다.

대상 사용자

NVIDIA DGX Spark 하드웨어에 접근이 가능한 개발자 및 연구자로, DeepSeek V4 Flash를 최대 효율, 긴 컨텍스트 기능(최대 384k 토큰), OpenAI 호환 API 접근을 원하는 분들입니다.

주요 특징

  • 단일 노드 배포: 두 번째 노드 없이 하나의 DGX Spark에서 작동.
  • 거대한 컨텍스트 창: 검증된 정확한 "바늘 찾기" 재현을 지원하며 최대 384,000 토큰까지 가능.
  • 예측 디코딩: DSpark K5 예측 디코딩을 사용해 토큰 생성 속도를 높입니다.
  • 최적화된 메모리 사용: 압축 KV 캐시와 튜닝된 GPU 메모리 활용률(0.94)로 여유 공간을 극대화합니다.
  • 런타임 제거 기능: 모델 가중치를 수정하지 않고도 거부 지시를 제거할 수 있는 선택적 비파괴적 런타임 프로젝션을 포함합니다.
  • 로컬 가중치 관리: 완전히 로컬인 가중치 다운로드 및 통합을 지원하며, SSHFS를 통한 옵션 LAN 공유 모드도 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트