MiaAI-Lab/Qwen3.8-27B-SGLang-DGX-Spark

Qwen3.8 27B on SGLang for DGX Spark

해결하는 문제

이 프로젝트는 NVIDIA DGX Spark (GB10) 하드웨어에서 Qwen3.8-27B 모델을 최적화된, 즉시 실행 가능한 Docker 스크립트로 제공합니다. 수동 튜닝의 추측을 제거하고, 다양한 사전 추측 디코딩 엔진에 대해 사전 측정된 설정을 제공하여 이 특정 아키텍처에서 최대 처리량과 안정성을 보장합니다.

작동 방식

이 저장소는 추론 엔진으로 SGLang을 사용하며, 이를 Docker 컨테이너로 래핑합니다. 토큰 생성을 가속화하는 사전 추측 디코딩 방법에 따라 세 가지 다른 서빙 모드를 제공합니다:

  • EAGLE/MTP: 사전 추측 디코딩에 체크포인트 내부 헤드를 사용합니다.
  • DSpark: 별도의 드래프트 모델을 사용하여 코드 및 일반 채팅을 가속화합니다.
  • DFlash2: 블록-디퓨전 드래프트 모델을 사용합니다 (사용자 정의 이미지가 필요하며 제공된 패치를 통해 빌드해야 함)로 코드 및 장문 글쓰기 양쪽 모두를 최적화합니다.

GB10의 ARM 아키텍처에서 성능을 극대화하기 위해 스크립트는 프로세스를 고성능 Cortex-X5 코어에 고정하고, FP8 KV 캐싱을 활용하여 메모리 사용량을 절약합니다. 또한 YaRN 스케일링을 통해 최대 100만 토큰까지 컨텍스트 창을 확장할 수 있습니다.

대상 사용자

NVIDIA DGX Spark (GB10) 하드웨어를 사용하고 있으며, SGLang 플래그와 메모리 분율을 수동으로 튜닝하지 않고도 Qwen3.8-27B를 최적 성능으로 배포하고자 하는 개발자 및 연구자들입니다.

주요 특징

  • 세 가지 사전 추측 엔진: MTP, DSpark, DFlash2 지원, 각각 다른 워크로드에 최적화되어 있습니다 (예: DSpark는 코드에 적합, MTP는 장문 에세이에 적합).
  • 하드웨어 특화 튜닝: Cortex-X5 코어에 고정되어 2-7%의 디코딩 속도 향상과 최적화된 GDN 상태 풀을 제공합니다.
  • 유연한 컨텍스트: 기본 262K 컨텍스트 지원과 YaRN을 사용한 최대 1M 토큰까지 확장 가능한 옵션 제공.
  • 자동 배포: 재진행 가능한 시작/정지 스크립트와 DFlash2 지원을 위한 자동 Docker 이미지 빌드 기능 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트