VRAM 예산 관리: 로컬 LLM을 위한 게임용 PC에 데이터센터 GPU 추가
로컬에서 대형 언어 모델(LLM)을 실행하는 개발자와 AI 애호가에게 가장 큰 병목 현상은 거의 항상 VRAM입니다. RTX 4080과 같은 고급 소비자용 카드가 뛰어난 게임 성능을 제공하지만, 16GB VRAM은 실제로 독점 클라우드 API와 경쟁할 수 있는 더 크고 강력한 모델에는 종종 부족합니다.
32GB 또는 48GB 소비자용 카드로 업그레이드하는 비용이 부담스러워질 때, 대안이 있습니다: 중고 데이터센터 시장입니다. 폐기된 Tesla V100 SXM2를 일반 게임용 PC에 통합하면, 새로운 하드웨어 비용의 일부만으로 사용 가능한 VRAM을 두 배로 늘릴 수 있습니다.
하드웨어: Tesla V100 SXM2
Tesla V100 SXM2는 NVIDIA의 DGX/HGX 서버 랙용으로 설계된 Volta 아키텍처 GPU입니다. 소비자용 카드와 달리 PCIe 커넥터, 디스플레이 출력, 표준 전원 커넥터가 없으며, 전용 보드에 장착되어 NVLink를 통해 통신하도록 설계되었습니다.
2017년에 출시된 오래된 모델임에도 불구하고, V100는 HBM2 메모리 덕분에 추론에 강력한 성능을 유지합니다. 4096비트 메모리 버스를 갖추어 900 GB/s의 대역폭을 제공합니다. 비교하자면, 이는 Apple M3 Max(400 GB/s)와 M4 Max(546 GB/s)의 메모리 대역폭을 능가하며, RTX 4080의 736 GB/s보다도 약간 앞섭니다. 메모리 대역폭이 초당 토큰 수를 결정하는 LLM 추론에서는, 가격 대비 V100가 매우 효율적인 선택이 됩니다.
커넥터 격차 극복
SXM2 카드를 일반 마더보드에서 사용하려면 서드파티 SXM2‑to‑PCIe 어댑터가 필요합니다. 이 베어 PCB는 전용 소켓을 표준 PCIe 엣지 커넥터로 변환하여 GPU를 기존 하드웨어와 함께 마더보드에 장착할 수 있게 합니다.
"지옥의 팬" 제어
데이터센터 GPU는 고정압 냉각을 갖춘 산업용 2U 서버 섀시용으로 설계되었습니다. 이 어댑터와 함께 제공되는 팬은 일반적으로 PWM이 없으며, 100% 속도로 지속 가동됩니다. 가정 환경에서는 약 82 dB의 소음 수준을 발생시키며, 이는 잔디깎이와 비슷합니다.
이를 해결하기 위해 팬 핀아웃을 수정할 수 있습니다. 어댑터의 JST PH2.0 커넥터를 찾아 2.54 mm 수컷‑to‑PH2.0 암 점퍼 케이블을 사용하면 팬을 마더보드 팬 헤더에 직접 연결할 수 있습니다. 이렇게 하면 PWM 제어가 가능해져, 팬을 10 % 속도로 동작시키면서도 GPU 온도를 풀로드 시 50 °C 이하로 유지하여 시스템 소음을 크게 줄일 수 있습니다.
NixOS를 이용한 소프트웨어 오케스트레이션
두 가지 서로 다른 GPU 아키텍처(RTX 4080의 Ada Lovelace와 V100의 Volta)를 결합하면 드라이버 호환성 문제가 발생합니다. NVIDIA는 드라이버 브랜치 560에서 Volta 지원을 중단했으므로, 두 카드를 동시에 지원하려면 레거시 드라이버가 필요합니다.
NixOS를 사용하면 이러한 의존성 관리를 단순화할 수 있습니다. 시스템을 가동하려면 다음과 같은 설정이 필요합니다:
- Kernel: Linux 6.6 (새 커널은 레거시 드라이버에서 지원되지 않을 수 있습니다).
- Driver:
nvidiaPackages.legacy_535(branch 550.x). - CUDA: Version 12.2 (구버전 nixpkgs 릴리즈에서 가져옴, 현재 버전은 12.6 이상을 제공).
- X Server: 반드시 활성화(
services.xserver.enable = true)해야 NVIDIA 커널 모듈이 로드됩니다. 헤드리스 서버에서도 마찬가지입니다.
성능 및 모델 실행
총 32 GB VRAM을 활용하면 Qwen3.6-27B-MTP(Q5_K_M으로 양자화)와 같은 모델을 GPU에 완전히 오프로드할 수 있습니다. llama.cpp를 텐서 분할(-ts 1.0,1.0)과 함께 사용하면 모델이 4080과 V100 두 GPU에 분산됩니다.
주요 성능 지표:
- Inference Speed: ‹32 토큰/초
- Prompt Processing: 133–160 토큰/초
- Context Window: 128k 토큰
이 모델의 중요한 장점 중 하나는 **멀티 토큰 예측(MTP)**으로, 모델이 여러 미래 토큰을 한 번에 예측할 수 있게 합니다. MTP가 최적화되면, 특히 코드와 같은 구조화된 출력에서 생성 속도가 50–60 토큰/초까지 급증할 수 있습니다.
비전 기능
mmproj 멀티모달 프로젝터 파일을 추가하면 이미지 입력을 지원합니다. 비전 인코더는 이미지 픽셀을 텍스트 토큰과 동일한 수학적 공간에 존재하는 벡터로 압축하여, 추가 1 GB VRAM만으로도 LLM이 이미지를 이해하도록 합니다.
주요 고려사항 및 트레이드오프
‘성능 대비 비용’이 높지만, 이 접근법에도 단점이 있습니다:
- Prefill Latency: 커뮤니티 멤버들이 지적했듯이 32 tok/s는 채팅에 좋지만, 프리필 속도(프롬프트 처리)는 에이전트 작업에 병목이 될 수 있습니다. 100,000 토큰을 150 tok/s로 처리하면 여전히 11분 이상이 소요됩니다.
- Hardware Limitations: V100은 많은 최신 모델에서 표준인
bfloat16을 지원하지 않습니다. 로컬 실험에 치명적인 문제는 아니지만, 염두에 두어야 할 하드웨어 제한입니다. - Power and Heat: 데이터센터 GPU는 유휴 전력 소모가 높으며(25–50 W), 활성 냉각이나 맞춤형 워터 블록이 없으면 거의 즉시 과열됩니다.
- Stability: 일부 사용자는 따뜻한 재부팅 후 GPU가 사라지는 ACPI 열거 문제를 보고했으며, 이를 복구하려면 완전한 콜드 파워 사이클이 필요합니다.
결론
드라이버, 커널, 하드웨어 점퍼 등을 직접 다룰 의향이 있는 사람에게는 중고 데이터센터 시장이 놀라운 가성비를 제공합니다. 약 £200 정도면 중급 게임용 PC를 독점 클라우드 서비스와 경쟁할 수 있는 모델을 실행할 수 있는 정식 AI 워크스테이션으로 변모시킬 수 있으며, 완전한 데이터 프라이버시와 토큰당 비용이 전혀 없는 장점을 누릴 수 있습니다.