无损模型压缩实验:GLM-5.2在25%的内存占用下
无损BF16压缩研究完整的GLM-5.2扫描发现30.168%的K15收费格式。一个单独的字节拆分表示在所有59,509个BF16张量中逐比特解码,减少了24.967%。这些是不同的证据类别。GLM-5.2 753B · BF16 K15会计 1,403 GiB -423 GiB减少30.17% [图00] GLM-5.2 753B K15收费格式会计:1,403.19到979.87 GiB,30.168%。单独的字节拆分精确反演:24.967%。如何运作 [图01] 01 / K15估算来源大部分权重共享少量符号符号。每个BF16权重为16位:一个符号,8个指数位,7个尾数位。在训练模型中,指数极为重复;少量值覆盖几乎每个权重。K15会计将9位符号和指数替换为4位编码,进入15个条目的表中。罕见的9位符号进入精确转义流;7位尾数保持原始。考虑所有附加成本,完整扫描此布局的价格为每个权重11.173位。 02 / 解码的内容字节拆分路径往返传输。流式验证器从其代码本、索引和转义流中重建高字节,逐字保留低字节,并逐个比特比较每个BF16张量与源。所有59,509个张量逐比特匹配。该解码表示的成本为每个权重12.005位,比BF16少24.967%。30.168%的K15布局是单独收费的会计,并未独立在GLM规模解码。 03 / 运行时证据和开放性工作密集原型,而不是服务结果单独的密集12位原型在寄存器中重建代码,并在A40上测量BF16 GEMV时间的0.733倍。稀疏转义修正单独验证,但未纳入该计时中。因此,确切的无损加速、物理GLM规模K15容器和端到端服务集成仍然处于开放状态。 04 / 先前工作和区别指数洞察和融合概念是先前的艺术ZipNN和DFloat11在此尺寸范围内建立了无损BF16指数压缩。DFloat11使用可变长度霍夫曼编码,并在矩阵乘法之前恢复BF16权重。ZipServ是最接近的先前运行时设计:它已经展示了固定长度编码和直接寄存器重建。该实验使用不同的表示方式,即每个张量4位代码覆盖15个联合符号和指数,有稀疏的精确转义,并不以新设计的身份提出共享的指数冗余,大约11位范围或融合概念的声明。 >>>重现协议不要相信它。自己运行。一个脚本,无需GPU。按块从Hugging Face流转检查点(约1.4 TB,删除后继续流转),逐比特验证字节拆分重建,并单独计算完全收费的K15大小会计。打开REPRODUCE.md -> 一个命令 uv run verify.py zai-org/GLM-5.2 无需GPU 输入BF16检查点,流转(约1.4 TB)精确路径字节拆分,所有59,509个张量 K15路径完全比特会计,无GLM规模解码已验证盲门,2026-07-12
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡