local-inference-lab/rtx6kpro

RTX 6000 Pro Wiki — Running Large LLMs (Qwen3.5-397B, Kimi-K2.5, GLM-5) on PCIe GPUs without NVLink

它解決了什麼

這個儲存庫提供了一份全面的技術指南和「實地維基」(field wiki),用於在 NVIDIA RTX PRO 6000 Blackwell (SM120) PCIe 系統上部署和優化尖端大型語言模型 (LLMs)。它透過提供可重複的 Docker 建置、精確的執行手冊 (runbooks) 以及針對無 NVLink 環境下高效能推論的硬體特定調優,消除了對「部落知識」(tribal knowledge) 的需求。

它是如何運作的

該專案圍繞幾個核心支柱組織了詳細的文檔和腳本:

  • 模型特定執行手冊 (Model-Specific Runbooks):運行 GLM、DeepSeek、Kimi 和 Qwen 等模型的逐步說明,包括特定的張量並行 (Tensor Parallelism, TP) 和解碼上下文並行 (Decode Context Parallelism, DCP) 設定。
  • 優化指南 (Optimization Guides):針對投機解碼 (speculative decoding) (MTP, DSpark, DFlash)、量化格式 (NVFP4, MXFP8) 以及核心優化 (kernel optimizations) (B12X, FlashInfer) 的技術深入探討。
  • 硬體調優 (Hardware Tuning):針對多 GPU 系統 (4、8 或 16 個 GPU) 的 PCIe 拓撲、頻寬優化和功耗限制的指導。
  • 驗證工具 (Validation Tools):使用 Kullback-Leibler Divergence (KLD) 檢查量化保真度的方法論,以及確保模型品質的行為保真度測試。

對象是誰

它專為操作 NVIDIA Blackwell 基於 PCIe 硬體的 AI 工程師和研究人員設計,這些人員需要使用 vLLM 和 SGLang 等引擎來最大化尖端 LLMs 的吞吐量和品質。

重點內容

  • 可重複的環境 (Reproducible Environments):包含 Docker 映像檔和建置腳本,以確保一致的執行環境。
  • 進階量化支援 (Advanced Quantization Support):針對 NVFP4 和 MXFP8 浮點格式的詳細實作說明。
  • 硬體特定基準測試 (Hardware-Specific Benchmarks):專為 RTX PRO 6000 Blackwell 系統設計的吞吐量和品質表格。
  • 拓撲優化 (Topology Optimization):針對 PCIe-switch 系統和 NCCL 調優的具體建議,以克服缺乏 NVLink 的問題。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案