AMD的Instinct MI455X:瞄准太阳
大家好,亲爱的互联网朋友们,在AMD的AI推进活动上,我们正在关注AMD全新的Instinct MI455X,它取代了旧版本的Instinct MI355X,成为其AI产品线的顶尖产品。这是AMD首次为机架级AI部署设计的GPU,基于全新的CDNA5架构,计算单元和SoC进行了重大改进,包括提高计算性能、改善内存带宽、增加内存容量,并使用了台积电的CoWoS-L封装。Instinct MI455X封装配备了新的Helios机架解决方案,使其可支持在单个设备中扩展至72个GPU,而之前的MI355X系统最多支持8个GPU。它还具有基于UALink over Ethernet (UAEoL)的新故障容错扩展网络架构,可在整个机架内实现单跳全向通信。AMD Helios机架单个MI455X包含256个工作组处理器(WGP),分布在8个加速器复杂芯片(XCD)上,最高“引擎”时钟为2.4GHz。这使得其峰值计算能力可达到315 TFLOP(用于矩阵/向量 FP32 和向量 FP16),以及最高40.26 PFLOP(对于OCP MXFP4)。这与12个HBM4堆叠配合,每个通过2048位总线连接,提供192个通道,使每个GPU总共拥有432 GB内存,带宽为23.3 TB/秒。MI455X概念概述 从“计算单元”的变化开始,AMD现在计算WGP而不是CU用于CDNA5。与他们在消费产品中所做的不同,在消费产品中,每个WGP被计算为两个CU。但就像RDNA4一样,每个WGP包含四个双发射的Wave32 SIMD32单元和4个标量单元,这与CDNA4的四个单发射Wave64 SIMD16单元有很大变化。这意味着每个WGP每个周期可以进行多达256个打包FP32操作(如果使用FMA,则为512 FLOPS)。为了支持这种新的SIMD设计,VGPR寄存器文件进行了重新组织,任何波形现在能够地址多达1024个VGPR,这个数字是先前CDNA和RDNA架构中的四倍。每个SIMD仍然具有128kB的向量寄存器,正如CDNA4一样,这意味着在实际上由于Wave32与Wave64的关系,它有两倍于(1024)的寄存器可用,但仍然少于RDNA4中可用的192kB。这还意味着在某些情况下,单个波前预计将占用整个SIMD。矩阵单元的性能也得到了增强,每个矩阵单元每个周期可以进行多达8192个FP4操作,每个WGP有4个矩阵单元,每个WGP每个周期可以进行多达65536个矩阵操作。这意味着在新的架构中,只有FP4和FP8在实际中更快,而其余性能来自于将SIMD宽度从16增加到32。Instinct MI455X内存子系统层次结构 WGP间缓存也进行了更改以支持这种新设计。L1数据缓存和LDS的大小都加倍,L1数据缓存为64 KB,LDS为320 KB,同时LDS带宽也加倍,以更好地供给这些CDNA5 WGP。但这主要是AMD新会计方式的产物,我们不会将WGP拆分为两个CU。每个XCD有32个WGP处于活动状态,34个物理WGP,但其中2个被解锁掉,分成每个XCD的2个着色器引擎(SE),每个引擎有16个WGP。着色器引擎与“广播仲裁器”配对,取代了RDNA4中的L1缓存(GL1),该缓存现在位于SE级别,而不是较低的着色器阵列级别。它不仅作为写合并缓冲区,同时还通过广播数据提供“多达4倍”的带宽放大。内存子系统现在允许多播加载,将矩阵乘法的速度显著加快,通过减少冗余内存流量。想象一下一个计算C=A×B的GEMM,通常我们会让每个波前单独加载一个块,如A操作数的LDS,每个WGP。通过多播加载,我们可以使用单个多播加载指令将此A块加载到所有相关的WGP中。每个波前仍然加载不同的B块,但MI455X可以从L2中获取公共的A数据一次,并使用广播仲裁器将其复制到所有相关WGP的私有LDS分配中。AMD称这为多达4倍带宽放大,尽管这种放大发生在L2之后,并不会四倍增加L2或HBM带宽。相反,L2流量的一单位变为四单位的本地送达数据,减少冗余的缓存读取和芯片连接流量,同时让每个WGP都有附近的数据副本。转向基础芯片,AMD现在有一个192 MB的全局L2,分为两个Fabric Cache Dies(FCD),每个FCD有96个1 MB SRAM块。每个FCD可以为该FCD上的128个WGP提供高达27 TB/s的L2带宽,总带宽可达54 TB/s。那些FCD与12个HBM4堆叠相连接,每堆叠有36 GB DRAM,总容量为432 GB HBM4,同时每个堆叠的运行速度为约7.6 GT/s/引脚,通过一个2048位总线连接,总内存带宽为23.3 TB/s。对于任何外部的I/O
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡