返回

文章详情

计算最优不等于集群最优

Hacker News2026年8月13日 17:40

规模规律将计算预算转化为模型:固定 FLOPs,最小化预测损失曲线,读取参数计数和标记预算。这是预训练最有用的工具,但它以集群不接受的货币来计价。集群不按 FLOPs 收费。他们按 GPU 小时收费。我在这个博客上对此进行了讨论。关于模型大小和训练时限的帖子结束时将计算转化为机器时间,Tmachine = Ctrain / (ρMFU · ρgoodput · S),而预训练研究图谱将 MFU-aware 比较归档在规模规律变得困难的地方:两个设计在损失每 FLOP 上可以持平,但在损失每 GPU 小时上却不同,第二个数字才是发票上的数字。我们与 Soumajyoti Sarkar 和 Yuxin Tang 合作的新论文将这一观察推向了结论。该框架 MOSAIC 将系统阶段融入到规模规律阶段:一个优化选择架构、标记预算和分布式执行布局,针对特定集群和特定训练窗口。标题揭示了发现:计算最优不等于集群最优。优化分子,看看那个分数的分母。良好利用率——作业在检查点、节点故障和输入停顿后运行的频率——是机群的特性,在选择任何架构之前就固定了。峰值吞吐量 SS 是硬件的特性。MFU——作业在运行时的表现——是架构在其最佳可行并行布局下的特性,这不是一个小的修正:两个具有相同预测损失的设计在实现吞吐量上可能相差几倍。无论如何,惯例将其视为常量。规模规律阶段选择架构和 FLOPs 中的标记预算;系统阶段继承架构并围绕其调优实施。(例如,Kimi K2 报告将稀疏 MoE 的规模规律和系统调优视为独立阶段。)这一工作流程在集群对整个分数收费时优化了分子。稀疏 MoEs 是其断裂处。专家混合模型用一组专家和路由器替换稠密 FFN,从而将活动参数——每个标记的 FLOPs——与总参数——内存占用——解耦。这引入了 Chinchilla 风格规律无法看到的轴:稀疏性和专家分割因子 GG,后者测量 FFN 宽度分割为专家的精细程度。论文在大约 150 次从零开始的 MoE 预训练运行中拟合了总参数、稀疏性、标记和 GG 的联合规律,涵盖了从 104M 到 2.7B 的活动参数以及总大小高达 79B。拟合规律给出了一个令人不安的结果。在固定模型 FLOPs 预算下,预测损失在整个经过校准的范围内随稀疏性单调下降。没有内部最优解。仅基于 FLOPs 的答案是“尽可能稀疏”,这不够作为设计原则,更像是缺乏原则。在硬件上为相同网络定价时,排序发生了逆转。在 512 个 GPU 的世界规模下,每个交付模型 FLOP 的墙钟时间随稀疏性单调上升,最高可达 1.70 倍于最稠密的配置。损失每 FLOP 排名第一的设计是集群运行最慢的设计。同一设计网格,从两个角度进行评分。在每个模型 FLOP 的损失(左侧)上,稀疏和更细粒度的胜出。在每个交付 FLOP 的墙钟时间(右侧)上,相同的选择是最慢的——在稀疏性轴上达到 1.70 倍,在专家分割轴上达到 2.66 倍。获胜者坐落在两端。从论文的图 8。将集群纳入问题中。MOSAIC 将模型-FLOPs 预算替换为可交付的 FLOPs:集群的原始上限乘以该候选在其最佳可行布局下可以达到的 MFU,再乘以良好利用率。只有当其配方所需的 FLOPs 符合集群在执行时可以交付的 FLOPs 时,候选才是可行的。MOSAIC 工作流程。集群输入从左侧进入;几何梯子提出可实现的架构;性能模型为每个架构以 MFU 计价,规模规律则以损失计价。结果是模型配置与执行该模型的布局。从论文的图 2。选择成为一个双层问题:外循环在可实现几何和标记预算的离散网格上最小化预测损失;内循环在设备内存的限制下,通过平行布局最大化可交付的 FLOPs——张量、管道、数据、上下文和专家程度、微批大小、激活检查点。MFU 和内存表面是测量查询而非符号函数,因此论文通过结构利用枚举而非通用求解器解决此问题。一个示例展示了约束的效果。要求 3.3×10^21 的模型 FLOPs,并给它四个 p6-B200 节点,运行五天。仅靠该规律就将稀疏性推到了搜索空间的边界。但在这个集群、这个窗口内,配置限制...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡