返回

文章详情

Unsloth 动态 3.0 GGUFs

Hacker News2026年8月19日 18:36

⌘ Ctrl k 基础 🦥 Unsloth 动态 3.0 GGUFs Unsloth 动态 v3.0 是我们动态量化的下一个迭代,是对动态 v2.0 的重大改进。今天,我们发布了 Qwen3.8-27B 动态 v3.0 量化,提供 >10% 的顶级 1% 更好准确度,且与其他提供者相比大小相同。这是我们首次共享动态 v3.0 的早期预览版本的更新。新的 3.0 GGUFs 与大多数推理引擎兼容,包括 llama.cpp 和 Unsloth Desktop。动态 v3.0 在保持相同大小的同时整体保留了更多模型质量,在 Divergence-300 @32 和 KL Divergence 等指标上取得更强的结果。非常感谢大家的支持!我们在短短 5 天内看到了超过 510 万次的 Unsloth Qwen3.8 下载!请看下面的更多图表/基准和分析。我们的新方法论包含许多新特性和改进。我们现在使用来自各种来源的更高质量的 imatrix 校准数据集。该数据集针对代理编码、对话和多语言性能进行了优化。我们还改进了层选择,并引入了更多量化技术,以尽可能保留模型质量。我们不在 imatrix 校准数据集上训练,也不使用 QAT 或 QAD。所有工作都是通过后训练量化完成的。我们使用的 imatrix 文件可供社区测试、评估和使用。我们鼓励研究人员和开发者使用我们的 Unsloth 量化/imatrix 创建 Qwen3.8 的变体和微调。您还可以阅读我们的过拟合分析。我们还从 UD-Q2_K_XL (8.37GB 及以下) 的较小量化中删除了 MTP 模块,以节省约 500MB 的磁盘空间 - 如果需要,您可以使用 Q4_0 MTP 单独模块。我们还制作了一些较小的 UD-1bit 量化,UD-IQ1_S 为 6.2GB (不含 MTP),保持约 72% 顶级 1% 的准确度,同时小了 89%。UD-Q2_K_XL 在顶级 1% 的准确性上比下一个最佳的高出约 8%,它的大小为 9.83GB,并成功创建了一个带有一个小 JS 错误的工作 HTML 程序 - 之前会崩溃。🔀 Divergence-300 @32 我们通常像 Kimi-K3 一样报告顶级 1% 的准确度,“动态 1-bit 达到 ~78.9% 顶级准确度,同时小了 62%。”然而,顶级 1% 是对 1 个预测的 argmax,因此在评估实际推理方面并不是很有效。我们创建了一个包含 300 个保留示例的数据集(不在校准数据集内),来自 Terminal-Bench 2.1 + DeepSWE + Harbor + MathArena 2025-26 + 非拉丁/长文提示,我们对 BF16 与所有量化和提供者进行了贪婪的 argmax 解码,解码 32 个标记。见过拟合分析以获取更多有关过拟合的详细信息。这使我们能够评估是否存在过拟合,以及量化输出是否与 BF16 在多标记上的轨迹相似。这是一个比顶部 1% 准确度更好的度量,因为我们将 KLD 顶部 1% 扩展到了类似 KLD 顶部 1% 在 32 个标记。🔀 KL 散度基准 我们也对所有提供商进行了 KLD 基准测试,并报告了顶部 1% 和 KLD 均值。在所有级别上,尤其是在较小的量化尺寸上,Unsloth UD-3 量化在相同的磁盘空间上获得了高达 +10% 的额外顶部 1% 准确度!所有图表在计算磁盘空间时都从 x 轴中删除了 MTP 头,以提供公平的比较。🕊️ 不过拟合 在与我们旧的 UD-2 在未见 Wikitext 和代码的比较中,我们在 KLD 上显示出了很大的改进 - 较大的量化效果不太明显,因此我们仍然使用旧的 UD-2 进行较大的量化 - 我们计划进行实验并改进它们!我们还通过使用完全不同的数据集来控制过拟合,并尽可能消除泄漏。我们在这些未见数据集上测试 KLD,并且我们不进行 QAD / QAT,仅进行纯 PTQ,因此与其他 QAD / QAT 方法相比,过拟合的担忧较少。同样,🔀 Divergence-300 @32 使用来自 DeepSWE、Terminal Bench 等的 300 个提示的未见数据集,并作为另一个数据集来评估过拟合 - 显示我们新的 UD-3 方法不会过拟合。动态 v2.0 (旧版) 我们正在推出 Unsloth 动态 v2.0 量化 - 对我们之前量化的重大升级。这种新方法超越了领先的量化方法,为 Aider Polyglot、5-shot MMLU 和 KL 散度设定了新基准。这意味着您现在可以在尽可能保留准确度的同时运行 + 微调量化的 LLM!您可以在大多数推理引擎上运行 2.0 GGUFs,如 llama.cpp、Unsloth Studio 等。2025年9月10日更新:您要求更严苛的基准测试,因此这是 Aider Polyglot 的结果!我们的动态 3-bit DeepSeek V3.1 GGUF 得分 75.6%,超过许多全精度的 SOTA LLM。阅读更多。您还可以查看 Benjamin Marie 为 LiveCodeBench v6、MMLU Pro 等进行的实际用例基准测试:您可以看到 Unsloth 的 GGUFs 表现优于非 Unsloth 量化,尽管小了 ~8GB。我们基准和评估的详细分析进一步以下。💡 动态 v2.0 中的新内容?为 GGUFs + safetensors 重新设计的层选择:Unsloth 动态 2.0 现在更具选择性地量化层。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡