LLM推理的有效边界
在人工智能行业,我们借用了经济学家的术语“有效边界”。我们用它来讨论权衡管理,最常见的是在成本和模型能力之间的权衡。如果一个模型在给定的成本或大小下提供最高的智能水平,那么它就是一个“边界模型”。有效边界展示了在资源受限环境中,在两个有价值的结果之间进行权衡时的最佳组合范围。推理工程中也存在有效边界。通常,这表现为延迟和吞吐量之间的权衡(这决定了成本),虽然我们也可以通过量化、蒸馏和剪枝在吞吐量与质量之间进行交换,或以推理水平在智能与速度之间进行权衡。有两种可供推理工程师使用的技术:一种是在两个因素之间进行权衡,以在有效边界上推动部署;另一种技术则是为给定的部署扩展整个边界,创造更多的整体效率,以便分配给最有利的结果。这两种技术都是有价值的。能够通过权衡来目标任何有效边界上的点是非常有用的。放弃每个用户的速度使得构建高吞吐量、低成本的批量工作负载流水线成为可能。当延迟敏感用户具有高度支付意愿时,牺牲吞吐量以提高速度是有意义的。当然,推动整个边界是极其有用的。解锁更多效率创造出可以分配给更低延迟、更高吞吐量或两者结合的增益。本文详细介绍了哪些推理工程技术允许您在边界上定位点,以及哪些技术推动整个边界向外扩展。对于本文,我们假设我们正在运行像GLM-5.3或Kimi K3这样的LLM进行代理编码,启用KV缓存重用和最优的KV感知路由。管理权衡的技术在生产中实现特定目标往往与发现某种新方法无关,而更多的是找到合适的配置集,考虑到流量的性质。管理权衡的技术使您能够在有效边界上定位结果。在实践中,有效边界是非常锯齿状的。结果之间并不是平滑、连续的线,而是微小的变化可以带来巨大的影响。这些截止点往往不直观,并且必须通过实验性地进行搜索来发现。批量大小延迟与吞吐量之间最明显的权衡来自于批量大小。批量是同时处理的请求数量。虽然基于标记的连续批处理意味着不需要等待批次开始的延迟,但配置的批量大小决定了每用户的延迟和总体吞吐量。对于小批量大小而言,每用户的延迟表现优异,但每个GPU生成的总标记数量较少。这意味着每个标记的成本相当高。增加批量大小则产生相反的效果:每用户的延迟更糟,但总体吞吐量更好,成本更低。并行策略当今的LLM参数达到数百亿甚至万亿,必须分散在多个GPU上。它们在GPU之间的共享或并行化方式可以提升延迟或吞吐量。并行性将大型模型分割到多个GPU上。对于延迟敏感的部署,专注于提高张量并行性(TP)。尽管TP的全到全通信成本高,但由于这些操作在高带宽NVLink互连上运行快速,因而有效地降低延迟。专家并行(EP)可以帮助改善延迟和吞吐量。较低程度的EP通常与更好的延迟相关,而广泛的EP,包括跨整个GPU机架的EP,通常支持更高的吞吐量。提高吞吐量的另一种并行化技术是注意力数据并行(ADP)。该技术复制注意力层以进行并行计算,从而提高系统吞吐量,同时降低每个请求的速度。量化量化,或者以较低精度的权重、激活和/或KV缓存值运行模型,可以改善延迟和吞吐量。量化模型向服务权衡的有效边界推进。然而,量化引入了一组关于质量和服务效率之间的新权衡。这是一个特别锯齿状的边界,在使用微缩浮点数格式(如MXFP4和NVFP4)时,服务效率可大幅提升而几乎不降低模型质量。推动边界的技术这些技术是备受报道的关键。改进整体性能是推理工程中最有趣的部分。推动边界的技术创造出普遍的增益。最棒的是,这些技术通常具有复合效应。例如,性能翻倍。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡