MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

GLM-5.3 Flash EXL3 for 2x DGX Sparks

해결하는 문제

이 프로젝트는 특정 고급 하드웨어(2x NVIDIA GB10 / DGX Sparks)에서 GLM-5.3-Flash 모델을 서비스하기 위해 고도로 최적화된 배포 레시피와 런타임 오버레이를 제공합니다. 이는 SM12x 아키텍처에서 이 특정 모델 아키텍처(NoPE MLA)를 실행하는 문제를 해결하며, 그렇지 않으면 호환되지 않는 KV 캐시 레이아웃과 누락된 sparse-MLA 커널로 인해 기본 vLLM에서 충돌이 발생합니다.

작동 방식

이 프로젝트는 vLLM 위에 사용자 정의 오버레이를 사용하여 여러 중요한 수정 사항을 구현합니다:

  • Sparse-MLA 지원: 모델의 잠재 차원을 제로 패딩하여 FLASHINFER_MLA_SPARSE_SM120 커널에 맞추고 SM12x GPU에서 효율적인 어텐션을 가능하게 합니다.
  • 양자화: 모델의 EXL3 4bpw 양자화 버전을 서비스하며, 퓨즈된 EXL3 MoE 커널을 활용하여 라우팅된 전문가들을 패킹된 상태로 유지합니다.
  • 추측 디코딩: 디코딩 속도를 높이기 위해 스페큘레이터로 DFlash2 (k=7)를 통합합니다.
  • KV 캐시 최적화: 패킹된 fp8_ds_mla KV 캐시와 "패딩된 슬롯 공유" 할당자를 구현하여 드래프트 모델과 타겟 모델이 메모리를 더 효율적으로 공유할 수 있도록 합니다.
  • Abliteration: 로드 시 모델 가중치에 거부 방향 제거를 적용하여 안전 거부를 우회하기 위한 선택적 런타임 훅(ABLIT=1)이 포함되어 있습니다.

대상 사용자

NVIDIA GB10/DGX Sparks 하드웨어에 액세스할 수 있으며, 최대 처리량, 긴 컨텍스트(최대 1M 토큰) 및 OpenAI 호환 API 액세스로 GLM-5.3-Flash를 배포해야 하는 AI 엔지니어 및 연구원을 위한 프로젝트입니다.

주요 특징

  • 높은 처리량: 4개의 동시 요청에서 초당 최대 146.5개의 집계 토큰을 달성합니다.
  • 대규모 컨텍스트: 최대 100만 토큰의 모델 길이를 지원합니다.
  • 효율적인 메모리: 4bpw EXL3 양자화를 사용하여 메모리 공간의 54%로 공식 FP8 품질을 일치시킵니다.
  • 하드웨어 특정: tensor-parallel size 2를 위해 sm_121a cubins 및 CX7 fabric에 맞게 특별히 최적화되었습니다.
  • 사용자 정의 패치: 긴 생성 중 충돌을 방지하기 위해 XGrammar 종료 및 Kpool slot-map 클램핑에 대한 백포트를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트