NVIDIA Vera 白皮書:技術優勢與行銷失誤
結論
NVIDIA 的 Vera 白皮書展示了一款技術上令人印象深刻、基於 Olympus 核心構建的 88 核心伺服器 CPU,然而它扭曲了 x86 SMT 行為、誇大了 NUMA 複雜性,並將標準基準測試重新品牌化為「agentic」工作負載,這削弱了其性能論點的可信度。
Olympus 核心亮點
- 10-wide out-of-order decode:前端每個週期可以解碼十條指令,並處理兩個已跳轉分支(taken branches)。
- Value prediction:Olympus 實現了一種廣泛的數值預測方案,與 Apple 的方法類似,允許依賴指令在預測結果正確時繼續執行。
- Neural branch predictor:採用了感知器(perceptron)風格的預測器,這在 AMD 的 Piledriver 和 Zen 1 中曾見過,儘管 AMD 現在更偏好使用 TAGE 以獲得更高的準確度。
- Graph prefetcher:功能上可與 Intel 的 Data-Dependent Prefetcher 和 Array-of-Pointers prefetcher 相比擬,但可能能夠處理更複雜的生產者-消費者鏈(producer-consumer chains)。
- Cache hierarchy:每個核心擁有 2 MiB 私有 L2 快取,且晶片共享 164 MiB 的系統級快取。整個晶片由 3.4 TB/s 的一致性互連結構(coherency fabric)連接。
- Memory subsystem:八個 LPDDR5X 通道可提供高達 1.2 TB/s 的頻寬,同時功耗約為 50 W,為記憶體密集型伺服器工作負載提供高頻寬。
"Olympus 似乎是一個快速的 CPU 核心,早期的獨立基準測試證實了其強大的單核性能。" – Chips and Cheese analysis
對 x86 SMT 的錯誤描述
- Figure 5 錯誤:NVIDIA 將傳統 SMT 描繪成交替的時間片階段(alternating time-sliced stages),暗示資源利用不足,而實際的 SMT 實現是動態共享流水線階段,並可以同時餵送兩個執行緒。
- Spatial Multithreading 聲稱:白皮書認為靜態分區可以提高確定性和 QoS,但它還暗示其性能增益比傳統 SMT 更大,這具有誤導性。
- 執行緒切換延遲:NVIDIA 內部溝通顯示,將 Olympus 核心切換回單執行緒模式時會有 10,000 個週期的懲罰,這是論文中未討論的因素。
"NVIDIA 的圖表對 SMT 在 x86-64 和其他 ISA 上的常見實現方式給出了誤導性的印象。" – Article analysis
NUMA 配置框架
- 32-node 聲稱:NVIDIA 將大型 EPYC chiplet 系統上可配置的 32 節點 NUMA 拓撲呈現為一種不可避免的缺點,而 AMD 的調優指南顯示這是一個可以禁用的可選設置(NPS4, NPS2, NPS1, NPS0)。
- Vera 的單節點設計:透過每個插槽僅暴露一個 NUMA 域,Vera 簡化了調度,但論文忽略了底層硬體仍具有分散式快取和記憶體控制器,因此延遲差異並未消除。
基準測試呈現問題
"Agentic" 基準測試
- NVIDIA 將四個 SPEC CPU 2026 整數工作負載(CPython, GCC, LLVM, 和 Cppcheck)標記為「agentic benchmarks」。這些是傳統的 CPU 程式;它們並不涉及 AI agents、運行時編排(runtime orchestration)或強化學習迴圈。
- 將它們框架化為端到端代理工作負載,誇大了其與 AI 工作負載的感知相關性。
SPEC 結果解讀
- 系統吞吐量:Vera (176 cores) 得分為 925 SPECrate,而 EPYC 9755 (256 cores) 為 898,系統級優勢僅為微弱的 3%。
- 單核性能:按物理核心進行歸一化後顯示,Vera 的單核速度快約 50%,部分測試的提升達到 70-80%。
- Figure 19 混淆:論文將全負載的雙插槽運行稱為「single-thread IPC」,掩蓋了每個核心運行兩個邏輯執行緒的事實。
- 缺失的 PMU 細節:計數器組(分支預測、後端操作等)缺乏事件名稱、採樣間隔和頻率數據,阻礙了獨立驗證。
記憶體頻寬聲稱
- NVIDIA 報告 Vera 達到了 ~1.1 TB/s,而 EPYC 9755 為 ~400 GB/s,暗示有 3 倍的優勢。
- 對 EPYC 9755 的獨立測試達到了 ~570 GB/s(其 614 GB/s 理論限制的 93%),這將 Vera 的優勢降低到總頻寬約 1.9 倍以及單核頻寬約 2.8 倍。
- 這種優勢主要源於 Vera 的八個 LPDDR5X-9600 通道,而非單一晶片(monolithic die)。
強化學習圖表
- Figure 24 顯示 RL 訓練有 1.8 倍的增益,但未提供關於模型、環境、批次大小(batch size)、功耗測量或統計置信度的細節,使得該聲稱無法復現。
獨立基準測試視角
- Phoronix (May 2026):Vera 的幾何平均值比 5 GHz 的 EPYC 9575F 高出 10%,比 Xeon 6980P 高出 1.55 倍,比 Grace 高出 1.63 倍,使其成為當時公開測試中最快的 Arm 伺服器 CPU。
- 測試限制:NVIDIA 限制了工作負載集,防止了頻率/功耗監控,並使用了生產前硬體,因此更廣泛的結論仍需等待量產矽片。
給讀者的啟示
- 硬體優點:Olympus 是一個高性能、10-wide 的 Arm 核心,具有先進的數值預測和強大的記憶體子系統。
- 行銷過度:白皮書誇大了 x86 SMT 的低效率,將可選的 NUMA 粒度視為預設限制,並將普通基準測試重新品牌化為 AI 專用。
- 數據透明度:缺乏原始性能計數器、不明確的基準測試配置以及缺失的方法論細節阻礙了獨立驗證。
社群反應(精選)
"喔,看啊,數值預測。這正是導致 Spectre 的那種東西。未來十年將會出現一個關於資訊洩漏與緩解措施的小型產業。" – @titzer
"我不認為挑選幾個 SPEC 基準測試...並稱之為『agentic benchmarks』有任何誤導性。普通運算需要造福代理(agents)才是 Nvidia 建造這顆晶片的原因。" – @twoodfin
"典型的偽裝成白皮書的大企業行銷材料。" – @pjmlp
"這很酷。我才讀了一半,但關於晶片內部及其功能的一些討論非常有趣。" – @foota
結論
NVIDIA 的 Vera CPU 展示了一個引人注目的架構,擁有強大的 Olympus 核心和高頻寬記憶體子系統。然而,隨附的白皮書透過誤導 x86 SMT 行為、誇大 NUMA 複雜性以及將標準基準測試重新包裝為以 AI 為中心的工作負載,削弱了其競爭敘事。獨立測試證實了強大的單核性能,但 Vera 的全面影響只有在量產矽片以透明的方法進行公開基準測試後才會明朗。
Sources
相關
- 專案
- Dispatch
- Dispatch
- Dispatch