INT8 ConvRot 的解释(FP8 不再需要)
名为 INT8 ConvRot 的建模与量化方法于 2026 年 7 月 1 日在 ComfyUI v0.27.0 中原生支持,成为热门话题。它对 GeForce RTX 20/30 系列特别有利,且据报道在 GeForce RTX 40/50 系列上提供超过以往标准的 FP8 和 FP8 Scaled 格式的性能。正因如此,INT8 ConvRot 被认为将成为所有 8 位量化模型的标准,Comfy-Org 方面也在推进其支持。由于此信息尚未广泛传播,许多人对此产生了误解或混淆,因此我将在本文中整理并解释这一点。 2026/7/7:新增 Forge Neo 现已支持 INT8 ConvRot 2026/7/6:新增关于 Kimama-san 的 INT8 ConvRot 评估结果的信息 2026/7/5:在《建模方法和格式的分类》中新增关于 GGUF 的信息 2026/7/5:在《如何使用 INT8 ConvRot》中新增关于 Triton 和 PyTorch 的信息 AI 模型存储格式 在解释 INT8 ConvRot 之前,我将介绍 AI 模型存储格式的基础知识。 建模与量化 AI 模型通常以 FP32 的 32 位 FLOAT 类型进行建模,以最大程度地提高精度,但由于即使是 SDXL 的结果文件大小也达到 12GB,模型通常会转换为 16 位、8 位或在某些情况下 4 位。位数越小,文件大小越小,处理起来更为方便,处理速度也更快。然而,由于可表示的数值减少,精度下降,因此会尽量使用一些方法和格式来最小化对精度和结果的影响。 建模方法与格式分类 下表粗略分类了 AI 模型的建模方法及格式。 $$ egin{array} {l|l|l} f{层次} & f{例} & f{角色} \ ext{文件格式} & ext{safetensors, GGUF,} & ext{保存容器} \ & ext{ONNX} & \ ext{编码方式} & ext{FP16, BF16,} & ext{以 bit 列表现数值的方法} \ & ext{INT8, FP8, FP4} & \ ext{缩放方式} & ext{无, Tensor-wise,} & ext{调整值范围的方法} \ & ext{Row-wise} & \ ext{量化方式} & ext{RTN, AWQ,} & ext{转换为低精度的算法} \ & ext{GPTQ, ConvRot} & \ \\end{array} $$ 我在网上搜索过这样的分类表但未能找到,于是我在与 ChatGPT 进行 Q&A 时自行创建了这个分类表。虽然表格可能比较粗糙或术语不当,但由于过多次纠正,我相信这个总体分类是正确的。 2026/7/5 更新:GGUF 不仅仅是文件格式,还明确了量化数据的存储方式,如 Q4_K_M,因此不能在上述分类表中进行组织。由于本文未涉及 GGUF,因此我将坚持使用上表中的分类,以免使组织变得复杂。顺便提一下,从广义上讲,使用这些方法和格式的建模有时被统称为“量化”,但在本文中,我将称之为“建模”,并将转换为低精度的算法称为“量化方法”。 请注意,有无数网站详细解释各个方法和格式,因此我在本文中不会对此进行说明。如有必要,请另行查找或向 AI 提问。关于 FLOAT 类型,Kimama-san 的文章提供了详细信息。 代表性模型格式与 INT8 ConvRot 基于上述分类表,代表性模型格式(包括 INT8 ConvRot)整理如下。 16 位模型 $$ egin{array} {l|l|l} f{层次} & f{FP16} & f{BF16} \ ext{编码方式} & ext{FP16} & ext{BF16} \ & & ext{(Brain FP16)} \ ext{缩放方式} & ext{无(固定)} & ext{无(固定)} \ ext{方式} & & \ ext{量化方式} & ext{RTN} & ext{RTN} \ \end{array} $$ 8 位 INT 类型模型 $$ egin{array} {l|l|l|l} f{层} & f{INT8} & f{INT8} & f{INT8} \ & & f{Tensor} ext{-} f{wise} & f{ConvRot} \ ext{编码方式} & ext{INT8} & ext{INT8} & ext{INT8} \ \ ext{缩放方式} & ext{无(固定)} & ext{Tensor-wise} & ext{Row-wise} \ ext{方式} & & & \ ext{量化方式} & ext{RTN} & ext{RTN} & ext{ConvRot} \ \end{array} $$ 8 位 FLOAT 模型 $$ egin{array} {l|l|l|l} f{层} & f{FP8} & f{FP8\,Scaled} & f{MXFP8} \ ext{编码方式} & ext{FP8} & ext{FP8} & ext{FP8} \ & ext{(E4M3/E5M2)} & ext{(E4M3/E5M2)} & ext{(E4M3/E5M2)} \ ext{缩放方式} & ext{无(固定)} & ext{Tensor-wise 等} & ext{单层} \ ext{方式} & & & ext{微缩放} \ ext{量化方式} & ext{RTN} & ext{RTN} & ext{RTN} \ \end{array} $$ 4 位模型 $$ egin{array} {l|l|l} f{层} & f{NVFP4} & f{MXFP4} \ ext{编码方式} & ext{FP4 (E2M1)} & ext{FP4 (E2M1)} \ \ ext{缩放方式} & ext{分层} & ext{单层} \ ext{方式} & ext{微缩放} & ext{微缩放} \ \
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡