local-inference-lab/rtx6kpro
RTX 6000 Pro Wiki — Running Large LLMs (Qwen3.5-397B, Kimi-K2.5, GLM-5) on PCIe GPUs without NVLink
해결하는 문제
이 저장소는 NVIDIA RTX PRO 6000 Blackwell (SM120) PCIe 시스템에서 최첨단 대규모 언어 모델(LLM)을 배포하고 최적화하기 위한 포괄적인 기술 가이드 및 "현장 위키"를 제공합니다. 재현 가능한 Docker 빌드, 정확한 런북, 그리고 NVLink 없이도 고성능 추론을 위한 하드웨어별 튜닝을 제공함으로써 "부족 지식(tribal knowledge)"에 대한 의존성을 제거합니다.
작동 방식
이 프로젝트는 다음과 같은 핵심 기둥을 중심으로 상세한 문서와 스크립트를 조직합니다:
- 모델별 런북: GLM, DeepSeek, Kimi, Qwen과 같은 모델을 실행하기 위한 단계별 지침으로, 특정 텐서 병렬(TP) 및 디코드 컨텍스트 병렬(DCP) 설정을 포함합니다.
- 최적화 가이드: 추측 디코딩(MTP, DSpark, DFlash), 양자화 형식(NVFP4, MXFP8), 커널 최적화(B12X, FlashInfer)에 대한 기술적 심층 분석을 제공합니다.
- 하드웨어 튜닝: 다중 GPU 시스템(4, 8, 또는 16개 GPU)을 위한 PCIe 토폴로지, 대역폭 최적화 및 전력 한도에 대한 지침을 제공합니다.
- 검증 도구: 양자화 충실도를 확인하기 위해 Kulback-Leibler 발산(KLD)을 사용하는 방법론과 모델 품질을 보장하기 위한 행동 충실도 테스트를 제공합니다.
대상 사용자
vLLM 및 SGLang과 같은 엔진을 사용하여 최첨단 LLM의 처리량과 품질을 극대화해야 하는 NVIDIA Blackwell 기반 PCIe 하드웨어를 운영하는 AI 엔지니어 및 연구자를 위해 설계되었습니다.
주요 특징
- 재현 가능한 환경: 일관된 런타임 환경을 보장하기 위한 Docker 이미지 및 빌드 스크립트를 포함합니다.
- 고급 양자화 지원: NVFP4 및 MXFP8 부동소수점 형식에 대한 상세한 구현 노트를 제공합니다.
- 하드웨어별 벤치마크: RTX PRO 6000 Blackwell 시스템을 위한 전용 처리량 및 품질 테이블을 제공합니다.
- 토폴로지 최적화: NVLink 부재 문제를 극복하기 위한 PCIe 스위치 시스템 및 NCCL 튜닝에 대한 구체적인 조언을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트