Qwen 3.8 27B表现优秀,但默认设置容易过度思考
2026年8月16日,星期五的重磅发布是Qwen 3.8 27B,这是来自阿里巴巴Qwen研究实验室的一款Apache 2许可的27B参数视觉能力的LLM。我期待这一款:27B对于在适度配置的笔记本电脑上运行模型来说大小恰到好处,而它的前身Qwen 3.6 27B也相当出色。Qwen对该模型自我报告的基准测试令人瞩目。它显示出在Qwen 3.6 27B和封闭权重的Qwen 3.7-Plus(这是Qwen在今年5月发布时最强的模型之一)之间的提升。听听独立基准测试对该模型的看法将会很有趣。我在两台不同的机器上运行该模型:我的128GB M5 Max MacBook Pro和一台NVIDIA DGX Spark。在这两台机器上,我运行LM Studio和他们的17GB Q4_K_M量化版本。我还尝试直接在Spark上使用llama-server。Qwen的文档描述该模型默认设置为xhigh以进行推理努力,而我正在尝试的LM Studio GGUF保持了这一默认设置:Qwen 3.8附带对reasoning_effort的官方支持,可以用来调整推理深度和控制成本:xhigh(默认):适用于需要全面分析的复杂任务 medium:平衡准确性和速度 low:高效推理,优化速度和成本这是一个搞笑的默认设置。绝对不是在消费硬件上运行该模型的好方法。我发现结果极其有趣。我很快就遇到了LM Studio默认上下文限制8192个标记的问题——Qwen在思考即便是最平凡的问题时已经消耗了这些标记。我将模型加载为最大262,144的上下文长度,这个问题就解决了。这是我第一次尝试增加上下文长度时得到的骑自行车的鹈鹕SVG。生成花费了21分钟,使用了22,276个推理标记生成了3,223个输出标记。你可以在这里查看推理跟踪。这是我用在本地机器上生成的最佳鹈鹕SVG——而这个Qwen非常小,只有17GB的文件大小。关于这方面,有很多值得称道的地方:自行车框架形状正确;两侧都有腿——这非常罕见;清晰的鹈鹕腔;翅膀伸展到触碰车把!运动线在后面,而不是在前面;背景恰到好处——漂亮的阳光、云朵、山丘、花朵和草。等待21分钟值得吗?绝对不值得。以下是关闭推理后运行的相同提示——转录在此。这次生成了3,715个标记,花费了137秒——刚过两分钟。为了完整性,我使用OpenRouter将相同的提示通过更大型的Qwen 3.8 2.4T-A95B(上周发布)运行,并得到了这个炫酷的动画SVG:您的浏览器不支持HTML5视频。我说Qwen在xhigh下倾向于过度思考,但这究竟有多糟糕?我尝试了一个更简单的提示,再次使用那个默认的超高设置:画一个圆的svg。Qwen的推理跟踪是这样的:用户要求的是一个圆的SVG绘图。简单的请求——但我想让它成为一个精心制作的作品。让我做一些超越<circle>的东西:一个独立的SVG文件,带有个性——也许是一个几何“圆的研究”,有微妙的动画、分层的环和独特的调色板。保持范围正确:他们要求的是一个圆的SVG。因此核心是一个圆。但我可以添加工艺:同心导向圆(像是罗盘/几何绘图)、刻度标记、主圆上的柔和渐变填充、克制的环境运动(一个缓慢旋转的虚线环,脉冲发光)。尊重首选减少运动?这更多的是针对CSS;SVG SMIL或CSS在SVG内部都可以。调色板选项:深青色墨水在温暖的纸上?还是淡白色上的大胆朱红色圆圈与海军蓝的构建线——包浩斯/罗盘绘图的气氛。让我选择“几何研究”的外观:酷灰色背景,还是明亮的纸白色?如果不是奶油色和土耳其红组合,那么纸白色是可以的。 [...] 几分钟后,生成了这个绝对美丽的动画圆圈,这完全不是我所要求的!您的浏览器不支持HTML5视频。我强烈推荐:忽略那个默认设置。最初将Qwen 3.8 27B运行在低或甚至没有推理水平上。这是一个很好的模型,但哇,那个默认设置真是一个糟糕的起点。它在边界框方面表现非常好。测试视觉模型的一个有趣方法是查看它如何在照片中返回物品的边界框。我看到之前的Qwen模型在这方面表现良好,因此我决定测试一下,在鹈鹕周围绘制边界框。我过去看到要求0-1000缩放产生良好的结果。我尝试了这个:llm -a https://static.inaturalist.org/photos/714731804/large.jpg \ -m lmstudio/qwen/qwen3.8-27b \ '返回这张照片中鹈鹕的JSON边界框,每个维度为0-1000缩放'
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡