返回

文章详情

热芯片2026:CUDA瞄准RISC-V – 作者:切斯特·蓝

Hacker News2026年8月24日 16:52

CUDA是GPU计算领域的巨头,包括机器学习应用。目前,CUDA支持x86-64和aarch64 CPU。现在,英伟达希望将CUDA支持扩展到RISC-V。这一举措为RISC-V CPU提供GPU计算的机会。英伟达的演讲重点讨论了RISC-V CPU需要满足的要求,以便与CUDA协同工作。基本上,他们想要一个服务器级的CPU和平台。英伟达首先要求RVA23 CPU,并遵循RISC-V的服务器SoC和服务器平台规范。这些规范包括RAS(可靠性、可用性和可维护性)功能、一个专用安全处理器以及其他基本功能。英伟达的绝大部分服务器级期望通过这些规范得以满足。英伟达还有一些超出上述RISC-V配置文件或平台规范的要求,因为他们发现没有这些功能很难让CUDA软件良好运作。他们不希望出现最低公分母问题,即无法使用性能增强扩展,因为无法保证它们将在支持这些扩展的硬件上运行。从英伟达的角度来看,这将迫使他们发布低效率的代码。英伟达以向量扩展作为例子,因为支持预言让他们能够避免分支。ACPI是一个更困难的要求。ACPI使软件能够发现硬件的功能,并可用于电源、性能和热管理。英伟达的软件团队在开始移植CUDA时对RISC-V硬件没有ACPI感到不满,但这个情况已解决。在2025年,UEFI论坛增加了对RISC-V ACPI的支持。RISC-V BRS(引导和运行时服务)规范去年获得批准,并包括ACPI。然后,英伟达要求PCIe一致性。英伟达提到了一种内存排序问题,即CPU已经写入数据,但该数据在缓存中。如果CUDA发起DMA请求将该数据复制到GPU,DMA引擎可能会从DRAM读取数据而错过在CPU侧缓存中修改的数据。在将结果从GPU复制回CPU时,CPU可能会从其缓存中读取过时的数据,因DMA引擎已将数据写入DRAM。如果系统没有PCIe一致性,软件必须显式失效缓存以避免这种情况。将缓存失效工作纳入CUDA堆栈将是困难的,英伟达认为PCIe一致性是服务器CPU的标准特性。RISC-V的服务器SoC规范建议硬件实现缓存一致性,但英伟达希望获得保证。英伟达还希望硬件支持点对点PCIe通信。没有此能力,两个设备之间复制的缓冲区必须通过CPU内存,这会影响性能并增加复杂性,因为这需要额外的同步信号。不幸的是,英伟达没有详细讨论所有要求。他们指出,目标是达到某个性能水平,整体清单不超过两页。到底是像两个双倍行距的页面加大号字体,还是像开放式考试允许的两张笔记页(学生会创造性地填写尽可能多的信息)仍然是一个悬而未决的问题。除了在RISC-V CPU上运行CUDA,英伟达简要讨论了NVLink Fusion的要求。NVLink Fusion让其他公司在他们的芯片上实现英伟达的NVLink IP,使他们能够与选择的自定义CPU共同使用英伟达的NVLink C2C链接。一个假设的产品将像英伟达的GB10一样,连接联发科技的CPU芯片与使用NVLink C2C的英伟达GPU。英伟达当然希望客户也能使用英伟达的CPU。但是,如果客户希望连接自定义CPU或其他加速器,英伟达仍希望他们使用自己的NVLink IP。自定义CPU可以是RISC-V的。NVLink Fusion的要求包括所有CUDA的要求,以及支持DOCA和NCCL等软件框架所需的内容。要求延伸到与英伟达建立紧密的合作关系,这听起来是显而易见的。集成IP可能是一个复杂的工作,往往需要密切合作,就像联发科技与英伟达在GB10上的合作一样。RISC-V的软件生态系统在赶上x86-64和aarch64之前还有很长的路要走。英伟达将CUDA引入RISC-V世界的努力是一个有前景的发展。不幸的是,这些努力并不一定意味着您可以将英伟达GPU连接到RISC-V系统并开始使用CUDA。现有的大多数RISC-V硬件将不符合英伟达的要求。事实上,如果任何RISC-V消费硬件在不久的将来满足这些要求,我将感到惊讶。ACPI显然是一个障碍,并且似乎很难让供应商采用。在aarch64世界中,尽管ACPI支持已经存在多年,支持情况仍然相当不佳。在2025年批准的RISC-V标准可能需要几年时间才能获得广泛支持,甚至更长。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡