返回

文章详情

Nvidia的Vera白皮书存在一些漏洞

Hacker News2026年8月5日 21:24

你好,互联网朋友们,NVIDIA发布了一份45页的白皮书,解释了Vera,这是该公司基于自身Olympus核心的第一个服务器CPU。从表面上看,Vera是一款令人着迷的芯片,拥有一个88核的单片计算Die,Olympus是一个10宽的Arm v9.2核心,具有价值预测、图形预取器、每个核心2MB的私有L2、164MB的共享最后级缓存,以及八个LPDDR5X内存接口,承诺实现1.2 TB/s的不俗性能。不幸的是,NVIDIA在白皮书中也花费了相当一部分篇幅试图将这些有趣的设计选择转变为关于x86的道德论。传统的同时多线程被描述为时间分片,一个可配置的NUMA拓扑被呈现为一个无法避免的32节点迷宫,四个SPEC组件变成了“有能力的基准”,未定义的性能计数比被称为因果证明,而一个没有标签的图示则成为1.8倍的强化学习结果。让人沮丧的是,Vera并不需要这样的帮助,早期的独立测试表明Olympus确实强大。这份白皮书的最强论点在于硬件,最弱论点在于围绕它的故事,所以让我们拆解这个故事。在开始锐利的讨论之前,先谈谈好的方面。Olympus是一个非常宽的乱序Arm核心。它的前端可以每周期解码十条指令,并处理每周期最多两个已采取的分支。NVIDIA描述了一种神经分支预测器、价值预测、内存重命名、大指令窗口、六个128位SVE管线、四个加载管线、两个存储管线、一个96KB的L1数据缓存,以及对2MB私有L2大约10周期的访问。88个这样的核心坐落在一个3.4 TB/s的一致性结构和一个分布式的164MB系统级缓存之后。更仔细地看核心,价值预测是Olympus的一项独特新增功能。这已经是一个研究领域很长时间,而价值预测使得Olympus能够在核心正确预测结果时,依赖指令可以继续移动,而不是在长延迟操作后堆积起来。研究人员发现,苹果在其核心中使用了价值预测,AMD也提到在Family 17h(Zen 1和2)中,他们可以预测一些浮点指令的值。然而,AMD的Family 17h实现相当有限,而Olympus似乎拥有更接近于苹果的更广泛的价值预测实现。但是,图形预取器并非NVIDIA独有。英特尔有类似的机制叫数据依赖预取器,自至少2022年以来已经在出货的硅中使用。英特尔最新的数据中心CPU,Granite Rapids,也有一个指针数组预取器,它“将为常量跨度加载预取的数据视为指针,并可能向与指针值相对应的内存地址发出预取请求。”这实质上与NVIDIA描述的图形预取器的生产者-消费者理念是相同的。英特尔的实现相当受限,因此NVIDIA的实现可能能够处理比英特尔的实现更复杂的链。因此,尽管Vera的图形预取器可能是一个能够处理更多工作负载的实现,但生产者-消费者预取并不是一个新理念。而“神经分支预测器”也并不是一个新思想。早在2012年,AMD就在Piledriver微架构中实现了一种感知机分支预测器,并在Zen 1中继续使用基于感知机的分支预测器。然而,从Zen 2开始,AMD仅将感知机BPU用于其初始方向预测,随后用TAGE预测器覆盖,因为它在错误预测方面带来了30%的减少。从Zen 5开始,AMD很可能已完全承诺使用TAGE预测器,如果不是在Zen 3或Zen 4就已经这样做了。转向SoC一侧,考虑到Olympus核心的强大,NVIDIA给Vera配备了同样强大的内存子系统。Vera将八个SOCAMM2 LPDDR5X模块配对,容量达到1.5TB,带宽为1.2TB/s。NVIDIA声称,已填充的内存子系统仅消耗约50瓦。传统的EPYC或Xeon平台可以提供更高容量的DIMM,便于替换,但在电路板面积和功耗上需要付出代价。最重要的是,我们可以看看更多的数据。5月份,Phoronix的Michael Larabel对当前Arm和x86服务器进行了早期Vera系统测试。在NVIDIA允许的测试集中,Vera的几何均值比5 GHz的EPYC 9575F高10%,比Xeon 6980P高1.55倍,比Grace高1.63倍,这使Vera成为我们在公共测试中看到的最强大的Arm服务器CPU。测试中存在重大警告,例如NVIDIA选择允许的工作负载范围,并不允许频率或电源监控。Phoronix测试的系统是预生产的,测试窗口仅为一天,这使得他们能够测试的内容受到严格限制,而不论NVIDIA设定的限制。这意味着更广泛的覆盖将在Vera能够在野外找到之前不得不等待。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡