RTX 5080 및 RTX 3090으로 Qwen 3.6 27B Q8을 80+ 토큰/초로 실행하기
NVIDIA RTX 5080과 RTX 3090을 결합한 듀얼‑GPU 구성은 Qwen 3.6 27B Q8 모델을 실행할 때 초당 80~90+ 토큰(tok/s)의 추론 속도를 달성할 수 있습니다. 이 성능은 특정 BIOS 설정, nvidia-open 드라이버, 그리고 Multi‑Token Prediction(MTP)과 speculative decoding을 포함한 llama.cpp 최적화를 조합함으로써 가능해집니다.
하드웨어 구성
두 개의 고성능 GPU를 지원하려면 마더보드가 PCIe 레인을 분할할 수 있어야 합니다. 이 설정에서는 Asus Prime X570-Pro를 사용해 16x PCIe 레인을 2x8로 분할했습니다. RTX 5080은 고품질 PCIe 4 리저를 통해 두 번째 슬롯에 연결됩니다.
VRAM 용량
RTX 3090(24GB)과 RTX 5080(16GB)의 VRAM을 합쳐 총 40GB를 제공합니다. 이를 통해 Qwen 3.6 27B Q8 양자화 모델을 전체 VRAM에 적재하면서 230k 컨텍스트 윈도우와 Q8 KV‑cache 양자화를 유지할 수 있습니다.
BIOS 및 시스템 설정
올바른 BIOS 구성은 멀티‑GPU 안정성과 성능에 필수적입니다. 시스템은 UEFI 모드로 부팅해야 하며, BIOS/MBR 모드로 부팅하면 복잡한 커널 파라미터 수정 없이 두 카드를 동시에 사용할 수 없습니다.
필수 BIOS 설정
- CSM (Compatibility Support Module): 비활성화
- Above 4G Decoding: 활성화
- PCI Subsystem Settings: 활성화
- ReSize BAR Support: 자동 또는 활성화
- PCIEX16_1 Link Mode: Gen 4
- PCIEX16_2 Link Mode: Gen 4
드라이버 및 커널 구성
다른 세대의 GPU(예: Ampere와 Blackwell)를 혼합하는 경우 nvidia-open 드라이버가 권장됩니다. open-gpu-kernel-modules와 같은 패치된 드라이버도 존재하지만, 서로 다른 GPU 아키텍처를 혼합할 때 종종 실패합니다.
연결 및 P2P 상태를 확인하려면 nvidia-smi topo -p2p r 명령을 사용할 수 있습니다. 동일한 카드를 사용하는 경우 nova 드라이버를 사용할 수 있으며, 이때 nvidia-dkms-open을 제거하고 nova 드라이버를 블랙리스트에 추가해 부팅 시 패치된 드라이버가 로드되도록 해야 합니다.
llama.cpp 구현
높은 처리량을 달성하려면 여러 GPU 아키텍처를 동시에 지원하도록 특정 빌드 플래그와 런타임 파라미터를 설정해야 합니다.
빌드 플래그
Ampere(RTX 3090)와 Blackwell(RTX 5080) 아키텍처를 모두 지원하려면 llama.cpp를 다음 CMAKE_CUDA_ARCHITECTURES 플래그와 함께 컴파일해야 합니다:
cmake -B build -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON -DGGML_CUDA_FA_ALL_QUANTS=ON -DCMAKE_CUDA_ARCHITECTURES="86;120" -DCMAKE_CUDA_COMPILER=/usr/local/cuda/bin/nvcc -DGGML_CUDA_NCCL=OFF
런타임 최적화 매개변수
다음 llama-server 구성을 사용해 성능을 극대화합니다:
- Speculative Decoding:
--spec-type ngram-mod,draft-mtp --spec-draft-n-max 3은 MTP speculative boost를ngram힌트와 함께 활용합니다. - Multi‑GPU Strategy:
-sm tensor은 GPU 간 텐서 분할을 활성화합니다. - VRAM Distribution:
-ts 2,3은 두 GPU에 걸쳐 VRAM이 완전히 활용되도록 카드 사용 비율을 설정합니다. - KV Cache:
-ctk q8_0 -ctv q8_0 --kv-unified은 컨텍스트 윈도우에 대한 메모리 사용을 최적화합니다.
성능 결과
Huihui-Qwen3.6-27B-abliterated-ggml-model-Q8_0.gguf 모델을 사용했을 때, 디코딩 중 평균 81.84~91.13 tok/s 를 달성했습니다. 프롬프트 평가 속도는 약 77.36 tok/s 입니다.
전력 및 열 고려사항
커뮤니티 피드백에 따르면 이 구성은 전력 소모가 크며, 풀 로드 시 약 700W를 소비합니다. 사용자는 고품질 전원 공급 장치(PSU)를 확보하고 전원 플러그의 열 축적을 모니터링해야 합니다. 전체 시스템 전력 소모는 1kW에 이를 수 있습니다.
커뮤니티 인사이트 및 대안
사용자 간 토론을 통해 여러 대안 최적화와 모델 선택이 제시되었습니다:
- Model Alternatives: 일부 사용자는 품질 향상을 위해
huihui버전보다heretic양자화된 Qwen 3.6 27B 모델을 권장합니다. - Tuning Parameters: 사고 모드에서는
--temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.00을, 코딩 모드에서는--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00을 권장합니다. - Speculative Tuning: 일부 사용자는 NVIDIA 하드웨어에서
--spec-draft-n-max 2가 3보다 더 안정적이라고 제안합니다. - Hardware Alternatives: 다른 사용자들은 PCIe 레인 지원을 늘린 MACHINIST X99 마더보드와 Xeon CPU를 사용해 두 개의 RTX 3080(20GB) 카드로도 비슷한 80 tok/s 성능을 얻었다고 보고했습니다.