返回

文章详情

Claude Fable 5.1 和 Claude Mythos 5.1

Hacker News2026年9月1日 18:01

我们推出了 Claude Fable 5.1 和 Claude Mythos 5.1。它们是世界上最先进的编码和知识工作模型——其研究能力为人工智能模型如何促进科学进步提供了早期的线索。Claude Fable 5.1 和 Claude Mythos 5.1 是同一模型,但具有不同级别的安全保障。Fable 5.1 是通用可用的,而 Mythos 5.1 仅通过我们的受信访问程序提供;其安全保障专门设计以支持网络安全和生命科学领域的工作。除了增强的能力外,Fable 5.1 在价格、数据保留和安全保障方面也采取了重要步骤,以回应客户的反馈。价格:Fable 5.1 在典型工作负载下的成本预计比 Fable 5 低 25%,无论在哪种情况下按令牌计费。这是因为我们降低了缓存读取的定价(即模型读取已处理和存储的输入)。对于高度自主的工作,节省的费用通常会更大——甚至达到约 45%。数据保留:我们的新企业边界安全保障(EFS)系统为客户提供完全隐私(与零数据保留策略相同),同时仍然处于防止对立使用的最前沿。EFS 通过将数据存储在完全由客户控制的云基础设施中实现,而不是由 Anthropic 控制。它将在今年秋季的后期分阶段向企业客户提供。在 EFS 可用之前,符合条件的客户将能够使用 Fable 5.1,且不进行数据保留。安全保障:我们改善了安全保障,以减少误报(即系统标记无害内容的情况)。在网络安全方面,我们最新的安全保障比之前减少了 60%的误报。这在一定程度上是因为 Fable 5.1 现在可以用于发现软件漏洞——尽管不能为漏洞开发利用工具。在生物学领域,我们建立了一个访问程序,与美国政府合作,开放 Claude Mythos 5.1 的先进生物学功能,以便科学家访问。我们期待很快为科学家开放注册。新的性能边界:Claude Fable 5.1 在编码、知识工作和长期问题解决任务上设定了新的标准。以下图表显示,Fable 5.1 的性能远高于其前身 Fable 5。当设置为低或中等努力时,Fable 5.1 以更低的成本达到与 Fable 5 相似或更好的结果。(请注意,在 Claude Code 中,Fable 5.1 默认设置为高努力,在 Claude Cowork 和 Claude.ai 中默认设置为中等努力。)Terminal-Bench-Science 0.1 准确性与成本 Fable 5.1 Fable 5 0102030405060得分 (%) 101520304050每个任务的平均成本 (美元,日志比例) 低 中 高 x高 最大 低 中 高 x高 最大 Terminal-Bench-Science 0.1 按成本(日志比例)和努力水平的得分。Fable 5.1 避免了导致较低质量工作的捷径,并且足够聪明,可以修复软件问题的根因。例如,在投资公司 Millennium 的测试中,Fable 5.1 找到了其内部系统上一个罕见崩溃的原因,而他们的工程师(或其他任何模型)在尝试了几年后都无法解释。这里,您可以看到 Fable 5.1 在各项基准测试中的对比:Fable 5.1 Fable 5 Opus 5 GPT-5.6 自主科学研究 Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4% 自主编码 Terminal-Bench 4.0 55.8% 60.9% (Mythos 5.1) 42.0% 52.3% 37.3% 知识工作 GDPval-AA v2 1853 1723 1824 1711 计算机使用 OSWorld 2.0 77.9% 部分 72.9% 部分 75.4% 部分 — 部分 41.7% 严格 36.1% 严格 39.6% 严格 — 严格 多学科推理 Humanity's Last Exam 60.9% 无工具 57.8% 无工具 56.6% 无工具 — 无工具 65.0% 有工具 63.8% 有工具 63.6% 有工具 — 有工具 商业工作流 AutomationBench 31.4% 17.1% 26.9% 19.6% 自主编码 CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2% Fable 5.1 在启用生产安全保障的情况下进行了评估。在这些安全保障干预的任务上,Fable 5.1 和 Fable 5 在 OSWorld 2.0 中都得了零分,而 Fable 5 在 AutomationBench 中也得了零分。在我们安全保障的所有其他干预中,网络安全任务由 Claude Opus 4.8 完成,生物学任务由 Claude Opus 5 完成。这可能会降低 Fable 5.1 和 Fable 5 在这些基准测试中的表现。Terminal-Bench-Science 0.1:每个模型的标准误差为 ±3.5–4.5 分。公开排行榜(每个任务 3 次试验,Claude Code 设备)报告 Claude Opus 5 为 30.0%,Claude Fable 5 为 21.4%;我们的设定重现了它们,分别为 29.0% 和 24.7%,均在噪音范围内。OSWorld 2.0:得分基于基准作者的 2026 年 8 月任务发布;Fable 5 和 Opus 5 在相同条件下重新执行。由于任务文件与早期版本不同,因此这些数字与以前发布的 OSWorld 2.0 结果不可直接比较,这就是为什么没有显示竞争对手得分的原因。我们的早期访问合作伙伴注意到了这些性能升级,

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡