預算 VRAM:將資料中心 GPU 添加到遊戲 PC 以用於本地 LLM

對於在本地運行大型語言模型(LLM)的開發者和 AI 愛好者而言,主要瓶頸幾乎總是 VRAM。雖然像 RTX 4080 這樣的高階消費級顯卡提供卓越的遊戲效能,但其 16GB 的 VRAM 常常不足以支援更大、更強大的模型,這些模型才能真正與專有雲端 API 競爭。

當升級到 32GB 或 48GB 消費級顯卡的成本變得過高時,還有另一種選擇:二手資料中心市場。透過將退役的 Tesla V100 SXM2 整合到一般的遊戲 PC 中,能以新硬體成本的一小部分將可用 VRAM 加倍。

硬體概述:Tesla V100 SXM2

Tesla V100 SXM2 是採用 Volta 架構的 GPU,專為 NVIDIA 的 DGX/HGX 伺服器機架設計。與消費級顯卡不同,它沒有 PCIe 連接埠、顯示輸出以及標準電源接頭,因為它原本是安裝在專屬板上,透過 NVLink 進行通訊。

儘管已於 2017 年推出,V100 仍因其 HBM2 記憶體而成為推論的強大引擎。擁有 4096 位元的記憶體匯流排,提供 900 GB/s 的帶寬。相比之下,這超過了 Apple M3 Max(400 GB/s)和 M4 Max(546 GB/s)的記憶體帶寬,甚至略高於 RTX 4080 的 736 GB/s。在 LLM 推論中,記憶體帶寬決定每秒 token 數,這使得 V100 成為價格上極具效率的選擇。

克服連接埠差異

要讓 SXM2 卡在消費級主機板上運作,需要使用第三方的 SXM2 轉 PCIe 轉接卡。這塊裸露的 PCB 將專屬插槽轉換為標準的 PCIe 邊緣連接埠,使 GPU 能夠與現有硬體一起插入主機板。

鎮壓「地獄風扇」

資料中心 GPU 設計用於工業 2U 伺服器機箱,採用高靜壓冷卻。這些轉接卡附帶的風扇通常是非 PWM 的,持續以 100% 速度運轉。在家庭環境中,噪音大約為 82dB,與割草機相當。

解決方法是修改風扇接腳配置。先找出轉接卡上的 JST PH2.0 連接頭,並使用 2.54mm 公頭對 PH2.0 母頭的跳線線,將風扇直接接到主機板的風扇插座。如此即可使用 PWM 控制,使風扇在滿載時以 10% 速度運轉,將 GPU 溫度維持在 50°C 以下,從而有效降低噪音。

使用 NixOS 進行軟體編排

結合兩種不同的 GPU 架構(RTX 4080 的 Ada Lovelace 與 V100 的 Volta)會產生驅動相容性問題。NVIDIA 在 560 版驅動分支中已停止支援 Volta,這意味著必須使用舊版驅動才能同時支援兩張卡。

使用 NixOS 簡化了這些相依性管理。要讓系統正常運作,需要以下設定:

  • Kernel: Linux 6.6(較新版本的核心可能不受舊版驅動支援)。
  • Driver: nvidiaPackages.legacy_535(550.x 分支)。
  • CUDA: 版本 12.2(從較舊的 nixpkgs 釋出取得,因為目前版本提供 12.6 以上)。
  • X Server: 必須啟用(services.xserver.enable = true),以載入 NVIDIA 核心模組,即使在無頭伺服器上亦是如此。

效能與模型執行

擁有合計 32GB 的 VRAM 後,像 Qwen3.6-27B-MTP(以 Q5_K_M 量化)這樣的模型即可完整卸載至 GPU。使用 llama.cpp 並搭配張量分割(-ts 1.0,1.0),模型會同時分佈在 4080 與 V100 上。

主要效能指標:

  • Inference Speed(推論速度): ‹32 tokens/second
  • Prompt Processing(提示處理): 133–160 tokens/second
  • Context Window(上下文窗口): 128k tokens

此模型的一大優勢是 Multi-Token Prediction (MTP)(多 token 預測),它允許模型一次預測多個未來 token。當 MTP 發揮效能時,生成速度可提升至 50–60 tokens/second,尤其在產生結構化輸出(如程式碼)時表現尤佳。

視覺能力

透過加入多模態投影檔案(mmproj),此配置支援圖像輸入。視覺編碼器將圖像像素壓縮成向量,這些向量與文字 token 共享相同的數學空間,使 LLM 能以額外僅 1GB VRAM 的開銷來推理圖像。

重要考量與取捨

雖然「每磅能力」相當高,此方法仍有其缺點:

  1. Prefill Latency(預填延遲):如社群成員所指出,雖然 32 tok/s 對聊天而言相當不錯,但預填速度(提示處理)可能成為代理工作負載的瓶頸。以 150 tok/s 處理 100,000 個 token 仍需超過 11 分鐘的等待時間。
  2. Hardware Limitations(硬體限制):V100 不支援 bfloat16,而這在許多現代模型中是標準。雖然對本地實驗而言不是致命問題,但需留意此硬體限制。
  3. Power and Heat(功耗與散熱):資料中心 GPU 的待機功耗較高(25–50W)。若未配備主動散熱或客製化水冷模組,將幾乎立即過熱。
  4. Stability(穩定性):部分使用者回報 ACPI 列舉問題,GPU 可能在溫暖重啟後消失,需要完整的冷重啟才能恢復。

結論

對於願意調整驅動、核心與硬體跳線的使用者而言,二手資料中心市場提供了極具價值的方案。約 £200 的投入,即可將中階遊戲 PC 轉變為正規的 AI 工作站,能執行與專有雲端服務相媲美的模型,同時確保完整的資料隱私與零每 token 成本。

Sources