在本地运行 Qwen3.8 27B:来自我的 Mac Studio 的真实数据
在过去的 10 天里,Qwen3.8 27B 一直在我的 Mac Studio 上作为后台助手安静运行。它将我的 RSS 源汇总成早晨摘要,重新命名并归档我扫描的 PDF,使其变得可搜索,并处理我扔给它的任何摘要事务。这些都是日常琐事。这正是吸引力所在:这是我第一次信任一个本地模型,让它独自处理这些琐事。然后上周,这个模型突然在 r/LocalLLaMA 上无处不在,我的资讯源充满了基准图表,我意识到我一直拥有那些线程大多数缺失的东西:一个实际上可以正确运行它的机器,以及测量它的时间。因此我进行了基准测试。每个模型五次定时运行,相同的提示,相同的机器,加上一个让我惊讶了两次的 1-bit 实验。这里是我测量的所有内容,以及这对你自己运行这个东西所需硬件的意义。简而言之,Qwen3.8 27B(Q4_K_M,17GB)在我的 Mac Studio M3 Ultra 上通过 Ollama 生成速度约为 14 tokens/s。它的前身 qwen3.6:27b 在同一台机器上生成速度约为 28.6 tokens/s。它在大约三分之一的 tokens 中回答相同的提示,因此每个完成答案的实际时间接近平局。1-bit 量化 (6.7GB) 在 llama.cpp 中以 27 tokens/s 的速度运行,并且能够正确提供事实,但无法明确给出答案。你需要过去几周的 llama.cpp。旧版本因未知模型架构而失败:'qwen35'。我自己遇到过这个问题。32GB 的内存可以舒适运行 Q4。16GB 则运行 Q2。下面的内存表列出了每种量化所需的数字。那么,Qwen3.8 27B 到底是什么?Qwen3.8-27B 是一个具有 27.3B 参数和混合注意力设计的紧凑模型(GGUF 中的架构标签是 qwen35,这一点稍后会很重要)。它是多模态的,内置图像和视频理解,具有 262,144 tokens 的原生上下文窗口,并且在 Apache 2.0 下发布。官方模型卡声称在 SWE-bench Pro 上得分为 61.7,在 GPQA Diamond 上得分为 89.2,这些数字在一年前被认为是前沿实验室的领域。社区反应迅速超过了那个基准表。让讨论火热的是人们在模型第一周所做的事情:一个团队将其接入了他们的编码管道,作为付费 API 模型的替代,并报告称运行良好,OCR 测试者声称质量超过了一些商业云层级。来自最受好评线程的一句话让我印象深刻:“这是第一个感觉不仅仅是玩具的本地模型。” 我的贡献是这些图表中大多数缺失的一个测量:这个模型在你今天可以买到的苹果硅上实际做的事情。我的数据:在同一台机器上,3.8 对比 3.6。我的日常机器是配备 256GB 统一内存的 Mac Studio M3 Ultra,也是我用于 DeepSeek V4 Flash 指南的同一台机器。我通过 ollama run --verbose 进行了每个模型的五次定时生成,变化了技术提示,回答长度约为 200-500 字,计算了平均值。这两个模型都是默认的 Ollama Q4_K_M 量化,磁盘大小几乎都是 17GB。qwen3.6:27b qwen3.8:27b 生成速度(5 次运行平均) 28.6 tok/s 14.0 tok/s 提示处理 95.0 tok/s 93.1 tok/s 运行间的波动 28.5-28.8(稳定如磐石) 13.2-15.4 每个答案使用的 tokens 1,950-3,340 890-1,090 重点数字先来:新模型的生成速度是前身的一半。同样的参数数量,相同的量化大小,相同的机器。混合注意力架构是新的,Ollama 中的 Metal 内核显然尚未跟上。我预计随着运行时的成熟,这一差距将缩小;其他新颖架构也经历过同样的事情。不过,这实际上并没有让我浪费时间。Qwen3.8 在大约 1,000 tokens 的情况下回答了相同的提示,而 3.6 则走了 2,000-3,300。数学计算:2,058 tokens 以 28.6 tok/s 生成需 72 秒,而 955 tokens 以 14.2 tok/s 生成仅需 67 秒。每个 token 生成较慢,每个答案响应较快。在生成时,CPU 几乎没有注意到,因为在苹果硅上,推理通过 Metal 在 GPU 上运行。这篇文章的封面图正好捕捉了这个时刻,通过 macmon 在生成中间拍摄:GPU 稳定工作在 100%,耗电 63.95W,CPU 仅耗电 6W,答案实时流出。Stats 菜单栏应用从 GUI 侧告诉了同样的故事:所有 60 个 GPU 核心在 100% 工作,系统功耗达到 291W:1-bit 实验:脑损伤,测量结果。本周最受好评的 Qwen3.8 线程庆祝 Unsloth 的 1-bit 量化,这是一个 6.7GB 的文件,发布者亲切地称之为“脑损伤量化”。一个 27B 模型在 7B 的内存占用下。我必须尝试一下。它运行良好,且快速:309 tok/s 的提示处理,27.2 tok/s 的生成速度。近乎是我 Q4 速度的两倍,在不到 8GB 的 RAM 中。然后我问了它一些问题。事实回忆相当不错:它知道堪培拉是澳大利亚的首都,并正确解释了背后的悉尼-墨尔本妥协。但当我问一个简单的 bash 一行命令时,它产生了一个有效的命令,然后无法停止自我怀疑,在不明确给出最终答案的情况下循环 400 tokens 的替代方案。这与 Unsloth 自己所说的相匹配:他们的量化
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡