local-inference-lab/rtx6kpro

RTX 6000 Pro Wiki — Running Large LLMs (Qwen3.5-397B, Kimi-K2.5, GLM-5) on PCIe GPUs without NVLink

解決する課題

このリポジトリは、NVIDIA RTX PRO 6000 Blackwell (SM120) PCIe システム上でフロンティア大規模言語モデル(LLM)をデプロイし最適化するための包括的な技術ガイドおよび「フィールドウィキ」を提供します。再現可能な Docker ビルド、正確なランブック、および NVLink なしの高性能推論のためのハードウェア固有のチューニングを提供することで、「部族知識」への依存を排除します。

仕組み

本プロジェクトは、詳細なドキュメントとスクリプトを以下のコアな柱を中心に構成しています:

  • モデル固有のランブック: GLM、DeepSeek、Kimi、Qwen などのモデルを実行するためのステップバイステップの手順書。特定の Tensor Parallelism (TP) および Decode Context Parallelism (DCP) 設定を含みます。
  • 最適化ガイド: 投機的デコーディング(MTP、DSpark、DFlash)、量子化フォーマット(NVFP4、MXFP8)、カーネル最適化(B12X、FlashInfer)に関する技術的な詳細解説。
  • ハードウェアチューニング: マルチ GPU システム(4、8、または 16 GPU)における PCIe トポロジー、帯域幅の最適化、電力制限に関するガイダンス。
  • 検証ツール: 量子化の忠実度をチェックするための Kullback-Leibler 分散(KLD)の使用法、およびモデル品質を確保するための行動忠実度テストの手法。

対象読者

NVIDIA Blackwell ベースの PCIe ハードウェアを運用し、vLLM や SGLang などのエンジンを使用してフロンティア LLM のスループットと品質を最大化する必要がある AI エンジニアや研究者向けに設計されています。

ハイライト

  • 再現可能な環境: 一貫したランタイム環境を確保するための Docker イメージとビルドスクリプトを含みます。
  • 高度な量子化サポート: NVFP4 および MXFP8 浮動小数点フォーマットの詳細な実装メモ。
  • ハードウェア固有のベンチマーク: RTX PRO 6000 Blackwell システム専用のスループットと品質のテーブル。
  • トポロジー最適化: NVLink の欠如を克服するための PCIe スイッチシステムおよび NCCL チューニングに関する具体的なアドバイス。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト