Qwen3.8-2.4T
此库包含FP8量化模型权重和后训练模型的配置文件,格式为Hugging Face Transformers。这些文件与vLLM、SGLang、TokenSpeed等兼容。量化方法为细粒度FP8量化,块大小为128,其性能指标几乎与原始模型相同。对于寻求无需基础设施维护的托管、可扩展推理的用户,Qwen Cloud提供官方Qwen API服务。尤其是,Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,具有更多功能,如视觉输入和非思考支持,默认情况下具有1M上下文长度,官方内置工具等。有关更多信息,请参阅Qwen3.8-Max概述。在Qwen3.5和Qwen3.6系列受到广泛社区采用后,我们很高兴地介绍Qwen3.8,这是迄今为止Qwen开放模型家族中最强大的版本。Qwen3.8首次将Qwen-Max级别模型开放发布。基于Qwen3.5的架构基础,Qwen3.8在编码、专业工作、研究以及长远任务上实现了显著的提升。除了能够回答更难的问题,Qwen3.8还旨在更可靠地完成复杂的多步骤任务。Qwen3.8亮点Qwen3.8具有以下增强功能:核心能力:在编码、专业工作、研究和长远任务上进行全面提升。代理执行:更强的自主规划能力和更好地处理环境反馈,从而实现更可靠的端到端任务完成。下游兼容性:更广泛支持流行的工具和开发工具,使其更容易集成到您现有的技术栈中。灵活的思维控制:推理深度可以通过reasoning_effort进行调节,历史消息中的推理上下文通过preserve_thinking得以保留。有关更多细节,请参阅我们的博客文章Qwen3.8-Max。模型概述类型:因果语言模型训练阶段:预训练和后训练语言模型参数数量:总计2.4T,激活状态下为95B隐藏维度:8192标记嵌入:248,320(填充)层数:92隐藏布局:23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) Gated DeltaNet:线性注意力头数量:V为128,QK为16头维度:128 Gated Attention:注意力头数量:Q为64,KV为4头维度:256旋转位置嵌入维度:64专家混合:专家数量:512激活专家数量:10路由 + 1共享专家中间维度:2048语言模型输出:248,320(填充)MTP(多标记预测):通过多个步骤进行培养上下文长度:本地支持262,144,可扩展至1,010,000个标记。基准测试结果Opus 4.8 Fable 5 GPT 5.6 Sol(最高) Qwen3.7-Max Qwen3.8-Max编码代理终端基准2.1 84.6 84.6 88.8 74.5 86.6 SWE-bench Pro 69.2 80.0 64.6 60.6 67.7 DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6 NL2Repo-Bench 69.4 -- -- 47.2 55.9 FrontierSWE 70.0 88.8 -- 40.7 73.5 MLS-Bench-Lite 42.8 49.9 46.2 31.7 41.0 PaperBench 80.3 88.8 90.5 64.8 93.0 AndroidBench 69.8 84.5 74.0 56.5 75.1 QwenSWEBench 84.0 86.3 73.5 63.4 80.7 QwenQoderBench 62.7 63.1 53.8 36.8 58.4 QwenReactBench 1694 1770 1564 1538 1724 QwenSVGBench 1648 1690 1758 1499 1713通用代理协作基准 72.3 75.9 71.5 64.6 74.8 工作空间基准 66.8 68.7 65.6 61.4 67.7 职业基准 48.4 57.4 45.4 31.3 53.4 技能基准 65.1 70.9 73.5 61.2 70.2 代理的最后考试(通过/得分) 27.0 / 45.1 -- / -- 30.6 / 53.6 11.8 / 31.1 27.0 / 52.4 自动化基准(通过@1) 27.2 29.1 29.7 14.2 27.3 工具马拉松验证(通过@1) 76.2 77.9 74.9 49.7 72.5 广泛搜索 72.9 81.2 -- 75.2 81.9 HLE w/ 工具 57.9 64.5 58.0 53.5 56.2 一般能力 GPQA Diamond 92.0 92.6 94.1 92.4 92.6 HLE 45.7 53.3 47.2 41.4 43.6 IFBench 62.2 63.5 72.7 79.1 82.8 $OneMillion-Bench(专家得分) 41.8 55.9 53.8 44.4 52.5 HealthBench 52.4 -- 55.3 54.5 60.2 PLawBench 69.6 70.2 72.3 58.9 73.2 PRBench-法律 52.7 57.6 57.6 48.5 57.6 PRBench-金融 51.9 55.8 55.5 46.8 58.3 MRCR v2 256K(8根针) 83.2 -- 93.8 86.7 92.9 LongBench v2 69.1 -- 67.1 65.3 66.3 1. Fable5结果可能涉及回退。2. 终端基准2.1:使用Claude Code(avg@10)评估,超时5小时,max_tokens=131,072。对于所有其他模型,我们报告通过工具显示的最佳已发布分数:Claude Opus 4.8和Claude Fable 5使用人工分析的Terminus 2(https://artificialanalysis.ai/evaluations/terminalbench-v2-1);GPT-5.6 Sol与Codex(https://openai.com/index/previewing-gpt-5-6-sol/)。3. SWE-bench Pro:使用Claude Code工具评估,temp=1.0,top_p=0.95,并使用256K上下文窗口。已纠正有问题的任务,并对所有基线在经整改的基准上进行评估。4. DeepSWE 1.1:使用Claude Code和mini-SWE-agent工具评估,temp=1.0,top_p=0.95,并使用256K上下文窗口。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡