返回

文章详情

Qwen 3.8 27B 已发布:开放权重,最佳本地稠密模型

Hacker News2026年8月14日 15:00

该仓库包含Hugging Face Transformers格式的后训练模型的FP8量化模型权重和配置文件。这些工件与Hugging Face Transformers、vLLM、SGLang、TokenSpeed等兼容。量化方法是细粒度的FP8量化,块大小为128,其性能指标与原始模型几乎相同。对于寻求无基础设施维护的托管、可扩展推理的用户,官方Qwen API服务由Qwen Cloud提供。特别是,Qwen3.8-27B将作为托管版本提供,具有更多生产特性,例如,默认情况下的1M上下文长度,官方内置工具。有关更多信息,请参阅Qwen3.8-27B概述。该服务即将推出,请保持关注更新。在Qwen3.5和Qwen3.6系列受到广泛社区采用后,我们很高兴推出Qwen3.8,这是迄今为止Qwen开放模型家族中最强大的生成模型。基于Qwen3.5的架构基础,Qwen3.8在编码、专业工作、研究和长远智能任务方面提供了显著改进。Qwen3.8-27B将这些进步带入一个紧凑、适合部署的稠密模型:一个原生视觉-语言模型,能够理解图像和视频,具备灵活的思维控制,旨在更可靠地完成复杂的多步骤任务。Qwen3.8亮点:Qwen3.8-27B具有以下增强功能:核心能力:编码、专业工作、研究和长远智能任务的全面改进。智能执行:更强的自主规划和更好地处理环境反馈,从而实现更可靠的端到端任务完成。下游兼容性:更广泛地支持流行的工具和开发工具,使其更容易集成到现有系统中。灵活的思维控制:思维模式默认开启,可以根据请求禁用;推理深度可以通过reasoning_effort进行调节,并通过preserve_thinking保留历史消息的推理上下文。视觉-语言理解:原生支持对图像和视频的理解,从STEM图表和文档到小时级视频。模型概述:类型:具有视觉编码器的因果语言模型;训练阶段:预训练和后训练语言模型;参数数量:27B;隐藏维度:5120;标记嵌入:248,320(填充);层数:64;隐藏布局:16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN));Gated DeltaNet:线性注意力头数量:48个用于V,16个用于QK;头部维度:128;Gated Attention:注意力头数量:24个用于Q,4个用于KV;头部维度:256;旋转位置嵌入维度:64;前馈网络:中间维度:17,408;语言模型输出:248,320(填充);多标记预测(MTP):经过多步训练;上下文长度:262,144原生,最多可扩展至1,000,000个标记。基准结果:文本性能 Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus4.6 最大编码智能终端编码 Terminal Bench 2.1 (Terminus) 73.0 63.4 64.0 51.7 78.2 智能编码 SWE-bench Pro 61.7 53.5 57.6 51.2 53.4 仓库级别代码生成 NL2Repo-Bench 42.3 36.2 41.1 -- 47.6 智能编码 DeepSWE 1.1 42.2 13.3 14.2 -- -- 软件工程 QwenSWEBench 79.0 49.3 59.2 -- 63.8 智能长远办公室工作 CoWorkBench 70.7 61.0 65.1 -- 68.2 专业工作任务 JobBench 33.4 21.8 27.6 -- -- 前沿智能任务 Agents' Last Exam Pass@1 20.4 分数 42.9 Pass@1 10.6 分数 27.3 Pass@1 13.2 分数 33.6 -- -- 通用指令遵循 IFBench 79.5 69.1 79.1 77.0 62.5 科学推理 GPQA Diamond 89.2 87.8 90.3 83.5 91.3 多学科推理 HLE 30.8 24.0 34.7 22.0 40.0 竞争编码 LiveCodeBench v6 90.3 83.9 89.6 -- 88.8 SWE-bench Pro:除Opus4.6 Max外,其他模型均使用Claude Code工具在temp=1.0、top_p=0.95和256K上下文窗口下进行评估。问题任务已被纠正,所有基线模型在完善的基准上重新评估。NL2Repo-Bench:使用Claude Code工具进行评估。为防止奖励黑客攻击,我们禁用试图访问特定代码库的Bash命令,例如pip download、pip install和git clone。DeepSWE 1.1:在temp=1.0、top_p=0.95和256K上下文窗口下,使用Claude Code工具进行评估。QwenSWEBench:用于评估模型软件工程能力的内部编码基准。使用Claude Code工具进行评估。报告avg@3的最大超时为8小时,max_tokens=32,768,温度为1.0,以及256K上下文窗口。CoWorkBench:评估计算机科学、金融、法律、医疗和其他生产领域的长远任务的内部共同工作基准。HLE:由GPT-4o评审。每行的最佳结果以粗体显示。空单元格(--)表示结果未...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡