NVIDIA Vera 白皮书:技术优势与营销失误

结论

NVIDIA 的 Vera 白皮书展示了一款基于 Olympus 核心、技术上令人印象深刻的 88 核服务器 CPU,但它歪曲了 x86 SMT 行为,夸大了 NUMA 复杂性,并将标准基准测试重新品牌化为“agentic”(智能体)工作负载,这削弱了其性能论点的可信度。


Olympus 核心亮点

  • 10-wide out-of-order decode:前端每个周期可以解码十条指令,并处理两个已跳转分支(taken branches)。
  • Value prediction:Olympus 实现了一种类似于 Apple 方法的广泛值预测方案,允许依赖指令在预测结果正确时继续执行。
  • Neural branch predictor:使用了感知器风格的预测器,此前曾在 AMD 的 Piledriver 和 Zen 1 中见过,尽管 AMD 现在更倾向于使用 TAGE 以获得更高的准确性。
  • Graph prefetcher:功能上可与 Intel 的 Data-Dependent Prefetcher 和 Array-of-Pointers prefetcher 媲美,但可能能够处理更复杂的生产者-消费者链。
  • Cache hierarchy:每个核心拥有 2 MiB 私有 L2 缓存,整个芯片共享 164 MiB 系统级缓存。整个芯片通过 3.4 TB/s 的一致性互连结构(coherency fabric)连接。
  • Memory subsystem:八个 LPDDR5X 通道可提供高达 1.2 TB/s 的带宽,同时功耗约为 50 W,为内存密集型服务器工作负载提供高带宽。

"Olympus 似乎是一个快速的 CPU 核心,早期的独立基准测试证实了其强大的单核性能。" – Chips and Cheese analysis


对 x86 SMT 的误读

  • Figure 5 错误:NVIDIA 将传统的 SMT 描绘为交替的时间分片阶段,暗示资源利用不足,而真实的 SMT 实现是动态共享流水线阶段,并可以同时为两个线程提供数据。
  • Spatial Multithreading 声明:白皮书认为静态分区提高了确定性和 QoS,但它还暗示了比传统 SMT 更大的性能增益,这是具有误导性的。
  • 线程切换延迟:NVIDIA 内部沟通显示,将 Olympus 核心切换回单线程模式时会有 10,000 个周期的惩罚,这一点在论文中并未讨论。

"NVIDIA 的图表对 SMT 在 x86-64 和其他 ISA 上的通常实现方式给出了误导性的印象。" – Article analysis


NUMA 配置框架

  • 32-node 声明:NVIDIA 将大型 EPYC chiplet 系统上可配置的 32 节点 NUMA 拓扑呈现为一种不可避免的缺点,而 AMD 的调优指南显示这是一个可以禁用的可选设置(NPS4, NPS2, NPS1, NPS0)。
  • Vera 的单节点设计:通过每个插槽仅暴露一个 NUMA 域,Vera 简化了调度,但论文忽略了底层硬件仍然具有分布式缓存和内存控制器,因此延迟差异并未消除。

基准测试展示问题

"Agentic" 基准测试

  • NVIDIA 将四个 SPEC CPU 2026 整数工作负载(CPython, GCC, LLVM, 和 Cppcheck)标记为“agentic benchmarks”。这些是常规的 CPU 程序;它们不涉及 AI agents、运行时编排或强化学习循环。
  • 将它们框架化为端到端 agent 工作负载,夸大了其与 AI 工作负载的相关性。

SPEC 结果解读

  • 系统吞吐量:Vera (176 cores) 得分为 925 SPECrate,而 EPYC 9755 (256 cores) 为 898,系统级优势仅为 modest 的 3%。
  • 单核性能:按物理核心归一化后显示,Vera 的单核速度快约 50%,部分测试的提升达到 70-80%。
  • Figure 19 混淆:论文将满载的双插槽运行称为“single-thread IPC”,掩盖了每个核心运行两个逻辑线程的事实。
  • 缺失 PMU 细节:计数器组(分支预测、后端操作等)缺乏事件名称、采样间隔和频率数据,阻碍了独立验证。

内存带宽声明

  • NVIDIA 报告 Vera 实现了约 1.1 TB/s 的带宽,而 EPYC 9755 为约 400 GB/s,暗示有 3 倍的优势。
  • 对 EPYC 9755 的独立测试达到了约 570 GB/s(其 614 GB/s 理论极限的 93%),这使 Vera 的优势降至总带宽约 1.9 倍和单核带宽约 2.8 倍。
  • 这种优势主要源于 Vera 的八个 LPDDR5X-9600 通道,而非单体芯片(monolithic die)。

强化学习图表

  • Figure 24 显示 RL 训练有 1.8 倍的增益,但未提供关于模型、环境、batch size、功耗测量或统计置信度的细节,使得该声明无法复现。

独立基准测试视角

  • Phoronix (2026年5月):Vera 的几何平均值比 5 GHz 的 EPYC 9575F 高出 10%,比 Xeon 6980P 高出 1.55 倍,比 Grace 高出 1.63 倍,使其成为当时公开测试中最快的 Arm 服务器 CPU。
  • 测试局限性:NVIDIA 限制了工作负载集,阻止了频率/功耗监测,并使用了预发布硬件,因此更广泛的结论仍需等待量产芯片。

给读者的启示

  1. 硬件优点:Olympus 是一个高性能、10-wide 的 Arm 核心,具有先进的值预测和强大的内存子系统。
  2. 营销过度:白皮书夸大了 x86 SMT 的低效性,将可选的 NUMA 粒度视为默认限制,并将普通的基准测试重新品牌化为 AI 特有的。
  3. 数据透明度:缺乏原始性能计数器、不明确的基准测试配置和缺失的方法论细节阻碍了独立验证。
  4. 未来验证:需要全系统功耗、频率以及 Spatial Multithreading 开/关的测量,以确认 Vera 的真实世界优势。

社区反应(精选)

"噢,看,值预测。这正是导致 Spectre 的那种东西。未来十年将会出现一个关于信息泄露和缓解措施的小型产业。" – @titzer

"我不认为挑选几个 SPEC 基准测试……并称之为‘agentic benchmarks’有什么误导性。普通计算需要造福 agent,这正是 Nvidia 构建这款芯片的原因。" – @twoodfin

"典型的伪装成白皮书的大公司营销材料。" – @pjmlp

"这很有趣。我才看到一半,但关于芯片内部及其提供的功能有一些非常酷的讨论。" – @foota


结论

NVIDIA 的 Vera CPU 展示了一个引人注目的架构,拥有强大的 Olympus 核心和高带宽内存子系统。然而,随附的白皮书通过歪曲 x86 SMT 行为、夸大 NUMA 复杂性以及将标准基准测试重新包装为以 AI 为中心的工作负载,削弱了其竞争叙事。独立测试证实了其强大的单核性能,但只有在量产芯片以透明的方法进行公开基准测试后,Vera 的全面影响才会明朗。

Sources

相关