MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
DeepSeek-v4-Flash 0731 recipe for 2x DGX Sparks
이 프로젝트는 DeepSeek-V4-Flash-0731 을 2노드의 NVIDIA DGX Spark 클러스터에서 실행하기 위한 배포 레시피(새 모델이 아님)입니다. vLLM, DSpark 예측 디코딩, NVFP4 양자화, RoCE 네트워킹을 결합하여 100만 토큰의 컨텍스트 창으로 모델을 제공합니다.
주요 기능:
- 2노드 텐서 병렬 (TP=2), NCCL/RoCE 사용, 워커/헤드 아키텍처 채택.
- DSpark 예측 디코딩 (5개의 드래프트 토큰)으로 더 빠른 생성.
- NVFP4 KV 캐시 (
nvfp4_ds_mla)로 대규모 컨텍스트를 메모리에 맞춤. - 100만 토큰의 상한선을 지원하며, 6개의 동시 시퀀스 처리 가능 (KV 풀이 약 249만 토큰이므로 안전).
- vLLM의 알려진 문제에 대한 핫픽스: 추론 중 정지 문자열이 발동되는 문제, 도구 호출 자르기, 프리필 스타베이션, CPU 스파이닝.
- 옵션의 비전 사이드카 (Qwen3-VL-4B) 및 Stage-C 프로파일 (더 높은 처리량용).
성능 (기본 Anemll 스택):
- 단일 채팅: 1토큰 이후 약 62–83 tok/s.
- 6개의 짧은 동시 채팅: 총 약 160–190 tok/s (스레드당 약 30–37).
- Stage-C 프로파일 (20만 토큰, 16슬롯): 315 tok/s (정적).
사용법: .env.dspark.example → .env.dspark로 복사, 클러스터 IP 설정, Docker 이미지 다운로드, 가중치 다운로드 후 워커 노드를 먼저 시작하고 헤드 노드를 시작합니다. README에는 환경 변수 표, 문제 해결 방법, 벤치마크 결과가 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- Dispatch