返回

文章详情

Qwen/Qwen3.8-2.4T-A95B

Hacker News2026年8月12日 15:01

该仓库包含Hugging Face Transformers格式的后训练模型的模型权重和配置文件。这些工件与vLLM、SGLang、TokenSpeed等兼容。对于希望获得管理好的、可扩展的推理而无需基础设施维护的用户,Qwen Cloud提供了官方Qwen API服务。特别是,Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,具有更多功能,如视觉输入和非思考支持,默认情况下1M上下文长度,官方内置工具等。有关更多信息,请参考Qwen3.8-Max概述。在Qwen3.5和Qwen3.6系列被广泛使用后,我们高兴地推出Qwen3.8,这是迄今为止Qwen开放模型家族中最强大的版本。Qwen3.8首次将一个Qwen-Max级别的模型公开发布。在Qwen3.5的架构基础上,Qwen3.8在编码、专业工作、研究和长时态自主任务方面实现了显著收益。除了能回答更难的问题外,Qwen3.8还被设计用来以更高的可靠性完成复杂的多步骤任务。Qwen3.8的亮点包括:核心能力:在编码、专业工作、研究和长时态自主任务上全面改进。代理执行:更强的自主规划能力和更好地处理环境反馈,从而实现更可靠的端到端任务完成。下游兼容性:对流行的工具和开发工具有更广泛的支持,使其更容易集成到现有堆栈中。灵活的思维控制:可以通过reasoning_effort调节推理深度,并通过preserve_thinking保留来自历史消息的推理上下文。有关更多详细信息,请参阅我们的博客文章Qwen3.8-Max。模型概述 类型:因果语言模型 训练阶段:预训练和后训练 语言模型 参数数量:总计2.4T,已启用95B 隐藏维度:8192 标记嵌入:248,320(填充) 层数量:92 隐藏布局:23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) Gated DeltaNet:线性注意力头数量:V为128,QK为16 头维度:128 Gated Attention:注意力头数量:Q为64,KV为4 头维度:256 旋转位置嵌入维度:64 专家混合:专家数量:512 已激活专家数量:10路由 + 1共享专家 中间维度:2048 LM输出:248,320(填充) MTP(多标记预测):使用多个步骤进行训练 上下文长度:本身为262,144,并可扩展至1,010,000个标记。基准结果 Opus 4.8 Fable 5 GPT 5.6 Sol(最大) Qwen3.7-Max Qwen3.8-Max 编码代理 终端基准 2.1 84.6 84.6 88.8 74.5 86.6 SWE-bench Pro 69.2 80.0 64.6 60.6 67.7 DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6 NL2Repo-Bench 69.4 -- -- 47.2 55.9 FrontierSWE 70.0 88.8 -- 40.7 73.5 MLS-Bench-Lite 42.8 49.9 46.2 31.7 41.0 PaperBench 80.3 88.8 90.5 64.8 93.0 AndroidBench 69.8 84.5 74.0 56.5 75.1 QwenSWEBench 84.0 86.3 73.5 63.4 80.7 QwenQoderBench 62.7 63.1 53.8 36.8 58.4 QwenReactBench 1694 1770 1564 1538 1724 QwenSVGBench 1648 1690 1758 1499 1713 一般代理 CoWorkBench 72.3 75.9 71.5 64.6 74.8 WorkSpaceBench 66.8 68.7 65.6 61.4 67.7 JobBench 48.4 57.4 45.4 31.3 53.4 SkillsBench 65.1 70.9 73.5 61.2 70.2 代理的最后考试(通过/分数) 27.0 / 45.1 -- / -- 30.6 / 53.6 11.8 / 31.1 27.0 / 52.4 自动化基准(通过@1) 27.2 29.1 29.7 14.2 27.3 Toolathlon验证(通过@1) 76.2 77.9 74.9 49.7 72.5 宽搜索 72.9 81.2 -- 75.2 81.9 HLE w/ 工具 57.9 64.5 58.0 53.5 56.2 一般能力 GPQA Diamond 92.0 92.6 94.1 92.4 92.6 HLE 45.7 53.3 47.2 41.4 43.6 IFBench 62.2 63.5 72.7 79.1 82.8 $OneMillion-Bench(专家分数) 41.8 55.9 53.8 44.4 52.5 HealthBench 52.4 -- 55.3 54.5 60.2 PLawBench 69.6 70.2 72.3 58.9 73.2 PRBench-法律 52.7 57.6 57.6 48.5 57.6 PRBench-金融 51.9 55.8 55.5 46.8 58.3 MRCR v2 256K(8根针)83.2 -- 93.8 86.7 92.9 LongBench v2 69.1 -- 67.1 65.3 66.3 1. Fable5的结果可能涉及回退。 2. 终端基准2.1:使用Claude Code(avg@10)评估,采用5小时超时和max_tokens=131072。对于所有其他模型,我们报告在工具中发布的最佳成绩:Claude Opus 4.8和Claude Fable 5与来自人工分析的Terminus 2(https://artificialanalysis.ai/evaluations/terminalbench-v2-1);使用Codex的GPT-5.6 Sol(https://openai.com/index/previewing-gpt-5-6-sol/)。 3. SWE-bench Pro:使用Claude Code工具进行了评估,temp=1.0,top_p=0.95,256K上下文窗口。已纠正的问题任务和在经过细化的基准测试上评估的所有基线。 4. DeepSWE 1.1:使用Claude Code和mini-SWE-agent工具进行了评估,temp=1.0,top_p=0.95,256K上下文窗口。我们报告两个工具中的最高分数;值得注意的是,Qwen3.8-Max在Claude Code上表现最佳。 5. NL2Repo-Bench:使用Claude Code工具进行评估。为了防止偏差,...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡