MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

DeepSeek-v4-Flash 0731 recipe for 2x DGX Sparks

이 프로젝트는 DeepSeek-V4-Flash-07312노드의 NVIDIA DGX Spark 클러스터에서 실행하기 위한 배포 레시피(새 모델이 아님)입니다. vLLM, DSpark 예측 디코딩, NVFP4 양자화, RoCE 네트워킹을 결합하여 100만 토큰의 컨텍스트 창으로 모델을 제공합니다.

주요 기능:

  • 2노드 텐서 병렬 (TP=2), NCCL/RoCE 사용, 워커/헤드 아키텍처 채택.
  • DSpark 예측 디코딩 (5개의 드래프트 토큰)으로 더 빠른 생성.
  • NVFP4 KV 캐시 (nvfp4_ds_mla)로 대규모 컨텍스트를 메모리에 맞춤.
  • 100만 토큰의 상한선을 지원하며, 6개의 동시 시퀀스 처리 가능 (KV 풀이 약 249만 토큰이므로 안전).
  • vLLM의 알려진 문제에 대한 핫픽스: 추론 중 정지 문자열이 발동되는 문제, 도구 호출 자르기, 프리필 스타베이션, CPU 스파이닝.
  • 옵션의 비전 사이드카 (Qwen3-VL-4B) 및 Stage-C 프로파일 (더 높은 처리량용).

성능 (기본 Anemll 스택):

  • 단일 채팅: 1토큰 이후 약 62–83 tok/s.
  • 6개의 짧은 동시 채팅: 총 약 160–190 tok/s (스레드당 약 30–37).
  • Stage-C 프로파일 (20만 토큰, 16슬롯): 315 tok/s (정적).

사용법: .env.dspark.example.env.dspark로 복사, 클러스터 IP 설정, Docker 이미지 다운로드, 가중치 다운로드 후 워커 노드를 먼저 시작하고 헤드 노드를 시작합니다. README에는 환경 변수 표, 문제 해결 방법, 벤치마크 결과가 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch