文章摘要
NVIDIA发布了Vera CPU白皮书,介绍其88核Arm v9.2架构芯片,但文中试图通过贬低x86来美化设计,使用误导性表述和未标注数据。实际上Vera硬件本身实力强劲,无需这些包装。
文章总结
好的,以下是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的表述。
英伟达Vera白皮书:性能强劲,但营销叙事有失偏颇
英伟达发布了其首款基于自研“奥林巴斯”(Olympus)核心的服务器CPU——Vera的45页白皮书。Vera是一款引人注目的芯片,拥有88核的单片计算核心,每个奥林巴斯核心是10发射宽度的Arm v9.2架构,具备值预测、图形预取器、每核心2MB私有L2缓存、164MB共享末级缓存,以及八个LPDDR5X内存接口,可提供1.2TB/s的带宽。
然而,白皮书花费了大量篇幅,试图将这些有趣的设计选择包装成一场针对x86的道德叙事。它将传统的同步多线程(SMT)描绘成时间分片,将可配置的NUMA拓扑呈现为不可避免的32节点迷宫,将四个SPEC测试组件称为“智能体基准测试”,将未定义性能计数器比率作为因果证明,并用一个未标注的图标来代表1.8倍的强化学习结果。
令人遗憾的是,Vera本身并不需要这种“包装”。早期的独立测试表明,奥林巴斯核心确实实力强大。白皮书最强有力的论据是硬件本身,而最薄弱的环节则是围绕它编织的故事。
硬件亮点:奥林巴斯核心与强大内存子系统
奥林巴斯是一个超宽度的乱序执行Arm核心。其前端每周期可解码10条指令,并处理最多两条分支预测。它配备了神经分支预测器、值预测、内存重命名、大指令窗口、六个128位SVE流水线、四个加载流水线、两个存储流水线、96KB L1数据缓存,以及约10个周期延迟的2MB私有L2缓存。88个核心通过一个3.4TB/s的一致性互联网络和分布式164MB系统级缓存相连。
其中,值预测是奥林巴斯比较独特的特性。当核心正确预测了结果,依赖该结果的指令可以继续执行,而无需等待长延迟操作。虽然AMD在Zen 1和2中也有类似实现,但范围有限,而奥林巴斯的实现更接近苹果的方案。
不过,图形预取器并非英伟达独有。英特尔自2022年起就在其芯片中使用了类似的数据依赖预取器。其最新的数据中心CPU Granite Rapids也拥有指针数组预取器,其核心思想与英伟达描述的图形预取器相同,都是生产者-消费者模式。英特尔的实现较为受限,因此英伟达的版本可能处理更复杂的依赖链。
“神经分支预测器”也非新概念。AMD早在2012年的推土机架构中就实现了感知机分支预测器,并在Zen 1中继续使用。但从Zen 2开始,AMD使用TAGE预测器来覆盖感知机的预测结果,因为后者能减少30%的预测错误。
在SoC层面,Vera配备了强大的内存子系统:八个SOCAMM2 LPDDR5X模块,最高支持1.5TB容量和1.2TB/s带宽,且功耗仅约50瓦。相比之下,传统的EPYC或Xeon平台虽然支持容量更高、更易更换的DIMM,但牺牲了板面积和功耗。
独立测试结果:性能领先,但存在局限
今年5月,Phoronix对早期Vera系统进行了测试。在英伟达允许的测试范围内,Vera的几何平均性能比5GHz的EPYC 9575F高出10%,是Xeon 6980P的1.55倍,是Grace的1.63倍,使其成为公开测试中性能最强的Arm服务器CPU。但测试存在重大限制:英伟达选择了允许的工作负载范围,且不允许进行频率或功耗监控。测试系统是预生产版本,时间窗口仅有一天。尽管如此,结果足以证明奥林巴斯核心的速度很快。
白皮书中的技术谬误与营销包装
对SMT的误导性描述:白皮书中的图表将传统SMT描绘成在两个线程间交替使用分支预测、解码、执行等阶段,而英伟达的“空间多线程”则是静态分区资源。这给人错误的印象。实际上,SMT实现通常共享流水线阶段,通过每周期选择线程或线程无关的方式服务。静态分区可能导致一个线程无法使用另一半的执行资源,而传统的每周期选择机制在遇到线程停顿(stall)时,能更有效地利用空闲资源。白皮书强调其方案在“确定性、隔离性和服务质量”上的优势,而非性能。此外,奥林巴斯核心从双线程模式切换回单线程模式需要约10,000个周期,这意味着软件需要谨慎管理线程。
对NUMA拓扑的片面解读:白皮书称大型双路x86系统可能暴露“多达32个NUMA域”,而Vera每路只有一个。但这是可配置的,AMD的调优指南列出了NPS4、NPS2、NPS1甚至NPS0模式。将每个末级缓存域暴露为独立NUMA节点是可选的。白皮书将这种可选的高粒度配置描绘成x86系统的必然现实。Vera的单NUMA域简化了调度,但并不能消除其88核、分布式缓存和一致性互联网络带来的物理距离。
基准测试的“AI化”包装:白皮书选择了四个SPEC CPU 2026整数工作负载(CPython、GCC、LLVM、Cppcheck),并将其称为“智能体基准测试”。这些确实是合法的CPU程序,但并非智能体:没有模型服务token,没有智能体运行时选择工具。将它们称为“智能体基准测试”是将部分重叠夸大为完整的端到端工作负载。白皮书正确地将SPEC结果标注为“估算值”,但数据显示,在双路系统下,Vera的总SPECrate得分仅比EPYC 9755高3%。Vera的优势在于每核心性能,约快50%,而选定的四个测试则快70-80%。白皮书还称图19为“单线程IPC”,但描述的是满载系统,且未说明IPC数据的采集方式。
无法审计的性能计数器:白皮书将奥林巴斯的IPC领先优势归因于四个计数器组(如分支预测、指令获取等),但未提供PMU事件名称、定义、原始计数、采样间隔和时钟频率等关键信息。跨指令集架构(ISA)的IPC比较本身就有问题,因为Arm指令和x86指令的工作量不同。更高的IPC可能只是因为二进制文件包含了更多做更少工作的指令。
内存带宽优势的夸大:白皮书声称Vera的内存带宽是“最新x86 CPU”的3倍。但根据我们对图灵(Turin)CPU的测试,我们测得的带宽约为570GB/s,而非英伟达声称的400GB/s。修正后,Vera的带宽优势从近3倍缩小到约1.9倍,每核心带宽优势从4.1倍缩小到约2.8倍。如果对比AMD为AI头节点推荐的EPYC 9575F,Vera的每核心带宽优势仅为40%。实际上,两款处理器都将约92-93%的理论带宽转化为实际带宽,Vera的胜利源于其更高的峰值带宽(1.2TB/s vs 614GB/s)和更少的核心数。白皮书将优势归功于单片计算核心,但我们的测试表明,基于小芯片的EPYC 9755能达到理论极限的93%,显然未被其小芯片拓扑所限制。此外,AMD在两天后发布的96核EPYC 9686F,其MRDIMM-12800内存配置在理论上提供了比Vera更高的总带宽和每核心带宽。
无法复现的基准测试:白皮书展示了2.6倍的PageRank优势,但未说明使用的变量,且缩放图在32核处停止。对于1.8倍的强化学习训练结果,白皮书仅展示了一排已完成任务的小方块,没有模型、环境、CPU/GPU分配、框架、批大小、功耗测量、重复次数或误差线,这根本不是一个基准测试。
结论:Vera本身很优秀,但白皮书削弱了其说服力
经过45页的阅读,我对Vera的评价高于对这份白皮书的评价。奥林巴斯核心看起来非常强大,其内存子系统也令人印象深刻。早期独立基准测试也证实了其性能。
然而,白皮书的竞争性论证非常薄弱:它错误地描述了x86 SMT,将可选的NUMA配置变成默认负担,将标准CPU测试重新标记为智能体工作负载,用1.8倍的每核心性能条掩盖了3%的双路总分优势,比较了无法审计的跨ISA计数器,将内存接口的胜利归功于单片设计的“美德”,并展示了一张无法作为性能数据的插图。
这些都不能说明Vera慢,只是让英伟达的“证明”比其营销文案所宣称的要小得多。下一轮Vera测试应该很简单:给独立评测者不受限制的生产硬件,让他们可以发布频率、功耗数据,测试空间多线程的开关效果,并运行他们选择的任何基准测试。如果Vera如其架构所暗示的那样出色,这些测试将比把x86 SMT画成一个小型双车道交通信号灯更有说服力。目前来看,英伟达的营销策略有损Vera的形象。英伟达已经打造了足够强大的CPU,无需再从营销管道中“借用”性能数据。
评论总结
根据评论内容,总结如下:
主要观点与论据:
技术讨论与认可(评论1,评分None):作者对芯片内部机制和功能表示赞赏,认为讨论“很酷”。关键引用:“This is neat... some really cool discussion about the internals of the chips and what they offer.”
竞争与批评Nvidia(评论2、5,评分None):评论2认为竞争推动变革,批评Nvidia“公然捏造”,如“Superchip”使用2年以上旧设计。评论5列举Nvidia误导历史:基准测试作弊、虚标显存(4GB仅3.5GB可用)、混淆命名。关键引用:“nothing provokes meaningful change without it... Nvidia's blatant fabrications”(评论2);“a long and consistent history of misleading their customers... selling GPUs as having 4gb vram when it was only 3.5gb usable”(评论5)。
基准测试争议(评论3,评分None):作者质疑将SPEC基准测试称为“agentic benchmarks”是否误导,认为需要大量“普通”计算才能体现代理扩展性。关键引用:“I don’t think picking a handful of SPEC benchmarks... and then calling them 'agentic benchmarks' is misleading at all.”
安全担忧(评论6,评分None):批评新CPU过度依赖“值预测”,忽视安全,可能加剧投机攻击。关键引用:“everyone seems to have forgotten... security... this new CPU is going all in on value speculation.”
平衡性: 正面观点(评论1)与负面批评(评论2、5、6)并存,评论3对基准测试持中立质疑态度。评论4简短提问“So, is this rip AMD”,未展开。