返回

文章详情

高效张量计算的线程寄存器解耦GPU执行模型

Hacker News2026年8月26日 19:08

作者:刘子涵,冷静文,周扬杰,丁怡彤,朱冠霖,黄逸露,金志恒,张琛,孙世轩,冯宇,吴安邦,郭敏怡,翁健,涂佳金,王俊松 论文链接:PDF HTML(实验性) 摘要:现代GPU越来越多地将张量核心集成到执行流水线中。尽管张量的总吞吐量持续增长,得益于在Ampere中从基于寄存器的操作数供应演变到Hopper和Blackwell中的无冗余内存基础供应,但有效地组织现代AI工作负载的完整张量计算流水线仍然具有挑战性。我们将基本瓶颈识别为固定的并行性和粗粒度的调度,这两者在交错着多样化非GEMM操作与GEMM的现代AI工作负载中暴露出来。为了高效地组织张量计算,我们提出了FIBER,一种扩展GPU SIMT(单指令,多线程)模型的新架构。它的基本执行实例,称为“光纤”,与私有寄存器所有权解耦,仅携带最小控制状态,同时通过共享视图访问SM的寄存器。这使得动态并行性扩展、细粒度寄存器级数据流调度成为可能,并为矩阵操作数供应提供了无冗余的替代方案。我们扩展了ISA、微架构和编译器,以实现共享寄存器寻址、无冲突的操作数传递和基于光纤的程序映射。在典型的混合精度LLM服务场景下,FIBER在Ampere上实现了2.25倍的端到端加速(原始FP16计算的加速为1.15倍),在Hopper和Blackwell上分别为1.8倍和2.09倍,内核级增益高达2.49倍。 主题:硬件架构(cs.AR) 引用为:arXiv:2608.19628 [cs.AR](或arXiv:2608.19628v1 [cs.AR]对此版本) https://doi.org/10.48550/arXiv.2608.19628 arXiv发行的DOI通过DataCite(待注册) 提交历史 来自:刘子涵 [查看邮箱] [v1] 2026年8月20日星期四 04:35:13 UTC(617 KB)

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡