Entrpi/ds4-on-spark
Entrpi/ds4, a Blackwell CUDA perf fork of antirez/ds4 on NVIDIA DGX Spark: one-command install, ~3x upstream prefill, ~1.5x decode, DSpark, and full continuous batch support
해결하는 문제
이 프로젝트는 NVIDIA DGX Spark 하드웨어에서 DeepSeek-V4-Flash 모델을 배포하고 서비스하는 간편한 방법을 제공합니다. 통합 메모리 장치에서 처리량과 컨텍스트 창 활용도를 극대화하는 과제를 해결하며, 업스트림 엔진의 고성능 대안으로 배치 서빙, 지속적 배치, 고급 메모리 관리를 추가합니다.
작동 방식
이 프로젝트는 Blackwell CUDA (sm_121)에 최적화된 ds4 엔진(DwarfStar 4)의 파생 버전을 사용합니다. 메모리를 미리 예약하지 않고, 요청에 따라 컨텍스트를 동적 매핑하고 실시간 시스템 가용 메모리와 비교하여 각 요청의 실제 메모리 요구량을 측정하는 '메모리 게이버넌스'를 구현합니다.
주요 기술 구성 요소:
- 예측 디코딩: DSpark를 사용해 손실 없는 예측 디코딩을 수행하여 속도를 향상시킵니다.
- KV 캐시 관리: 디스크 영속 KV 백업을 사용해 재시작 후에도 데이터를 유지하는 프리픽스 캐싱을 구현합니다.
- API 호환성: OpenAI(Chat/Completions/Responses) 및 Anthropic Messages API를 지원하여 Claude Code, OpenAI Codex 등 에이전트와 호환됩니다.
- 메모리 게이버넌스: 메모리를 동적으로 관리하여 단일 Spark 장치에서 최대 300만 토큰의 활성 컨텍스트를 유지 가능하며, 메모리 부족 시 타입 기반 거부 응답을 제공합니다.
대상 사용자
NVIDIA DGX Spark(GB10/SM121) 또는 고성능 Blackwell GPU(RTX PRO 6000 / 5090급)를 사용하고, 최대 100만 토큰의 대규모 컨텍스트 창과 높은 처리량을 필요로 하는 에이전트 워크플로우용 DeepSeek-V4-Flash를 서빙해야 하는 개발자 및 연구자.
주요 특징
- 고성능: 업스트림 엔진 대비 2.4
3.3배의 프리필 처리량, 1.331.47배의 디코딩 속도 향상. - 대규모 컨텍스트: 모델의 전체 100만 토큰 창을 지원하며, 최대 300만 토큰의 활성 주거 컨텍스트를 유지 가능.
- 에이전트 최적화: 도구 사용을 위한 프로토콜 리마인더 포함, 추론 에코 제거 옵션으로 프롬프트 길이 16~28% 단축 가능.
- 원클릭 설치: 호스트 검증, 엔진 빌드, GGUF 모델 다운로드, 서버 실행을 한 번의 설치 스크립트로 자동 처리.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch