返回

文章详情

Laguna S 2.1

Hacker News2026年7月21日 17:17

今天我们发布了Laguna S 2.1,这是我们在开发追求更长时间工作并有效利用推理模型方面的重要一步。Laguna S 2.1是一个总参数为118B的专家混合模型,每个token激活8B参数,支持最高1M tokens的上下文窗口,包括思考模式和非思考模式。它从训练开始到发布不到九周时间,并且在长时间编码基准测试中与许多大规模模型相抗衡。我们今天发布的每个基准得分,都会在trajectories.poolside.ai上发布最终评估集中每个试验的完整轨迹。Laguna S 2.1 118B-A8B Tencent Hy3 295B-A21B Inkling 975B-A41B Nemotron 3 Ultra 550B-A55B DeepSeek-V4-Pro Max 1.6T-A49B Kimi K3 2.8T-A50B Qwen 3.7 Max — Muse Spark 1.1 — Claude Fable 5 — Terminal-Bench 2.1 在Terminal-Bench 2.1上解决的任务。SWE-Bench多语言 在SWE-Bench多语言上解决的任务。SWE-Bench Pro(公共数据集) 在SWE-Bench Pro(公共数据集)上解决的任务。DeepSWE 在DeepSWE上解决的任务。SWE Atlas(代码库问答) 在SWE Atlas(代码库问答)上解决的任务。Toolathlon验证 在Toolathlon验证上解决的任务。基准截至2026年7月21日。每个任务平均进行4次尝试,除了DeepSWE、SWE Atlas(代码库问答)和Toolathlon验证,后者每个任务进行3次尝试。对于所有基准,我们取供应商自我报告分数、基准作者排行榜或第三方排行榜(人工分析)的最大值,除了SWE Atlas(代码库问答),我们不使用第三方排行榜数据。Laguna S 2.1(118B-A8B) Tencent Hy3(295B-A21B) Inkling(975B-A41B) Nemotron 3 Ultra(550B-A55B) DeepSeek-V4-Pro Max(1.6T-A49B) Kimi K3(2.8T-A50B) Qwen 3.7 Max(—) Muse Spark 1.1(—) Claude Fable 5(—) Terminal-Bench 2.1 70.2 71.7 63.8 56.4 64.0 88.3 74.5 80 88.0 SWE-Bench多语言 78.5 75.8 - 67.7 76.2 - 78.3 - - SWE-Bench Pro(公共数据集) 59.4 57.9 54.3 - 55.4 - 60.6 61.5 80.3 DeepSWE 40.4 - - - 9.0 69.0 - 53.3 70.0 SWE Atlas(代码库问答) 46.2 - - - 27.2 - - 42.2 - Toolathlon验证 49.7 - 45.5 34.3 55.9 - - 75.6 - 超出其重量级别的表现 Laguna S 2.1在其重量级中,被我们衡量的结果来看,是最强大的代理编码模型,差距显著。S 2.1在启用思考的情况下,在我们的代理控制下,在Terminal-Bench 2.1上得分为70.2%。其紧凑的尺寸使其非常适合在本地机器上进行复杂工作。基准 开放权重 关闭/大小未披露 1 GPT-5.6 Sol 88.8 2 Kimi K3 2.8T-A50B 88.3 3 Claude Fable 5 88.0 4 GPT-5.6 Terra 87.4 5 GPT-5.6 Luna 84.7 6 Claude Opus 4.8 84.6 7 Claude Sonnet 5 80.4 8 Muse Spark 1.1 80.0 9 Qwen-3.7 Max 74.5 10 Hy3 295B-A21B 71.7 11 Laguna S 2.1 118B-A8B 70.2 12 MiniMax M3 428B-A23B 66.0 13 DeepSeek-V4-Pro-Max 1600B-A49B 64.0 14 Inkling 975B-A41B 63.8 15 DeepSeek-V4-Flash-Max 284B-A13B 61.8 16 Nemotron 3 Ultra 550B-A55B 56.4 17 Inkling-Small 276B-A12B 52.7 18 Qwen3.6-27B 27B 51.3 19 Qwen3.6-35B-A3B 35B-A3B 44.9 20 Nemotron 3 Super 120B-A12B 38.6 21 Laguna XS 2.1 33B-A3B 33.4 22 Mistral Small 4 119B 21.4 基准截至2026年7月21日。每个任务平均进行4次尝试,除了DeepSWE、SWE Atlas(代码库问答)和Toolathlon验证,后者每个任务进行3次尝试。对于所有基准,我们取供应商自我报告分数、基准作者排行榜或第三方排行榜(人工分析)的最大值,除了SWE Atlas(代码库问答),我们不使用第三方排行榜数据。Terminal-Bench 2.1评估了一系列广泛、高质量的长时间任务,代理模型通过终端与其环境连接。Laguna S 2.1在这一基准测试中是其尺寸类别中的突出模型。基准 Laguna S 2.1 其他Laguna 其他披露模型 总参数数,对数刻度。未披露总参数数量的模型被省略。深入了解DeepSWE 以上基准都是有意义的,我们很高兴在这些基准上接近前沿。但这种接近部分是成熟基准的特性:随着前沿的发展,顶级分数聚集在70-90%范围内,而表现非常不同的模型最终相差不超过几分。Datacurve的DeepSWE仍然有显著的提升空间。其任务是长时间且难以部分解决的,分数实际上可以扩展:前沿模型在v1.1变体上的得分范围为54%到73%,一些1T+参数的开放模型得分低于10%。在DeepSWE v1.1上,Laguna S 2.1在池控制下的思考模式得分为40.4。开放权重 关闭/大小未披露 1 GPT-5.6 Sol 73.0 2 Claude Fable 5 70.0 3 GPT-5.6 Terra 70.0 4 Kimi K3 2.8T-A50B 69.0 5 GPT-5.6 Luna 67.2 6 GPT-5.5 67.0 7 Claude Opus 4.8 59.0 8 Claude Sonnet 5 54.0 9 Grok 4.5 54.0 10 Muse Spark 1.1 53.3 11 GPT-5.4 52.0 12 GLM 5.2 753B-A40B 44.0 13 Laguna S 2.1 118B-A8B 40.4 14 Gemini 3.5 Flash 37.0 15 Kimi K2.7 Code 31.0 16 Claude Sonnet 4.6 30.0 17 Gemini 3.1 Pro 12.0 18 DeepSeek-V4-Pro-Max 1600B-A49B

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡