local-inference-lab/rtx6kpro
RTX 6000 Pro Wiki — Running Large LLMs (Qwen3.5-397B, Kimi-K2.5, GLM-5) on PCIe GPUs without NVLink
解决的问题
本仓库提供了一份全面的技术指南和“现场维基”,用于在 NVIDIA RTX PRO 6000 Blackwell (SM120) PCIe 系统上部署和优化前沿大语言模型(LLMs)。它通过提供可复现的 Docker 构建、精确的操作手册以及针对硬件的调优,消除了对“部落知识”的依赖,从而实现在无 NVLink 环境下的高性能推理。
工作原理
该项目围绕几个核心支柱组织详细的文档和脚本:
- 特定模型操作手册:针对 GLM、DeepSeek、Kimi 和 Qwen 等模型的逐步运行说明,包括具体的张量并行(TP)和解码上下文并行(DCP)设置。
- 优化指南:深入探讨推测解码(MTP、DSpark、DFlash)、量化格式(NVFP4、MXFP8)以及内核优化(B12X、FlashInfer)。
- 硬件调优:针对多 GPU 系统(4、8 或 16 个 GPU)提供关于 PCIe 拓扑、带宽优化和功耗限制的建议。
- 验证工具:使用 Kullback-Leibler 散度(KLD)检查量化保真度的方法论,以及确保模型质量的行为保真度测试。
适用人群
专为在基于 NVIDIA Blackwell 的 PCIe 硬件上运行前沿 LLM 的 AI 工程师和研究人员设计,他们需要使用 vLLM 和 SGLang 等引擎来最大化吞吐量和质量。
亮点
- 可复现的环境:包含 Docker 镜像和构建脚本,以确保一致的运行时环境。
- 高级量化支持:提供 NVFP4 和 MXFP8 浮点格式的详细实现说明。
- 特定硬件基准测试:专门针对 RTX PRO 6000 Blackwell 系统的吞吐量和质量表格。
- 拓扑优化:针对 PCIe 交换系统的具体建议以及 NCCL 调优,以克服缺乏 NVLink 的问题。
相关
- 项目
- 项目
- 项目
- 项目
- 项目