用于LLM生成GPU内核的合同级验证器
查看PDF HTML(实验性)摘要:使用语言模型生成GPU内核的系统报告了较高的正确率。该正确率来自一个单一的宽松测试:在固定形状下使用一些随机输入运行内核,如果输出接近参考值则接受它。一个内核可以通过该测试,但仍然可能是静默错误。它可能返回一个普通数字,而真实答案是NaN或无穷大,或者在不同运行中有所不同,当形状变化时会崩溃,或在fp16中累积,而参考保持一个fp32的总数。我们构建了能够正确检查正确性的工具:一个合同级验证器,包含十二个对抗门,每个门都是正确内核必须满足的属性,其中几个是无容忍的,因此没有任何阈值选择可以解释失败。该验证器面向外部,审计了2,638个被公共系统的自身框架已经接受为正确的机器生成内核。它发现39.5%的内核超出了任何容忍的论据,并且62.1%至少存在一个违规。该领域的标准测试接受了1,487个被验证器拒绝的内核,而只有14个是相反的。我们用四种独立方式来捍卫这一发现:7/7的阳性对照,阈值校准扫描,98.5%与参考基准自身正确性代码的一致性,以及分层手动审计。面向内部,验证器评估了我们自己的一个内核:第一个原生的Blackwell tcgen05训练,向后兼容被控线性递归(GDN)系列,包括该领域仍在备用运行的反向状态阶段。我们在独立的双精度oracle面前确立了其正确性,并通过它训练了五个系列成员。在内核生成中报告的进展背后的正确性信号远比数字所暗示的要弱,而一组无容忍合同将填补大部分差距。评论:17页,3个图。也存档于doi: https://doi.org/10.5281/zenodo.21563213主题:机器学习(cs.LG);硬件架构(cs.AR);分布式、并行和集群计算(cs.DC)引用为:arXiv:2608.12700 [cs.LG](或者arXiv:2608.12700v1 [cs.LG],指本版本)https://doi.org/10.48550/arXiv.2608.12700 arXiv发布的DOI通过DataCite(注册待定)提交历史来自:Rishi Shah [查看邮箱][v1] 2026年8月13日星期四 01:25:56 UTC(149 KB)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡