返回

文章详情

Opus 5 目前在人工智能分析排行榜上排名第一

Hacker News2026年7月24日 19:45

人工分析智能指数 v4.1 包含 9 项评估:GDPval-AA v2、𝜏³-银行业、终端基准 v2.1、SciCode、人类的最后考试、GPQA 钻石、CritPt、AA-全知、AA-LCR,推理模型用灯泡图标表示。人工分析智能指数 v4.1 包含:GDPval-AA v2、𝜏³-银行业、终端基准 v2.1、SciCode、人类的最后考试、GPQA 钻石、CritPt、AA-全知、AA-LCR。有关更多详细信息,请参阅智能指数方法论,包括每项评估的拆解及我们的执行方式。人工分析智能指数由开放权重/专有人工分析智能指数提供,v4.1 包含 9 项评估:GDPval-AA v2、𝜏³-银行业、终端基准 v2.1、SciCode、人类的最后考试、GPQA 钻石、CritPt、AA-全知、AA-LCR,推理模型用灯泡图标表示。指示模型权重是否可用。如果权重可用但商业使用受限(通常需要获得付费许可证),则标记为“商业使用受限”。智能评估是由人工分析独立测量的,分数越高越好。代理业务操作推理模型用灯泡图标表示,虽然模型智能通常可以跨用例转换,但特定评估可能与某些用例更相关。人工分析智能指数 v4.1 包含:GDPval-AA v2、𝜏³-银行业、终端基准 v2.1、SciCode、人类的最后考试、GPQA 钻石、CritPt、AA-全知、AA-LCR。有关更多详细信息,请参阅智能指数方法论,包括每项评估的拆解及我们的执行方式。AA-公文包 AA-公文包 Elo AA-公文包是由人工分析开发的代理知识工作基准。AA-公文包 Elo 是一个综合指标,汇总了评分标准通过率、分析质量 Elo 和表现 Elo,分数越高越好。推理模型用灯泡图标表示。AA-公文包 Elo 是一个综合指标,汇总了分析质量 Elo、表现 Elo 和评分标准通过率,通过合成的头对头比赛将评分标准表现转换为 Elo。Elo 和 95% 置信区间界限限制在 0。AA-全知 AA-全知指数 AA-全知指数(分数越高越好)测量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,而拒绝回答不受惩罚。分数范围从 -100 到 100,其中 0 表示正确答案和错误答案数量相等,负分数意味着错误答案比正确答案多。推理模型用灯泡图标表示。AA-全知指数(分数越高越好)测量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,而拒绝回答不受惩罚。分数范围从 -100 到 100,其中 0 表示正确答案和错误答案数量相等,负分数意味着错误答案比正确答案多。开放性人工分析开放指数:分数开放指数在 0 到 100 的标准化范围内评估模型开放性(分数越高越开放)。推理模型用灯泡图标表示。智能指数比较智能指数与每项智能指数任务的成本人工分析智能指数 · 每项人工分析智能指数任务的加权平均成本(美元)最具吸引力的象限,推理模型用灯泡图标表示。每项智能指数任务的加权平均成本。每项评估的成本通过输入、缓存命中、缓存写入、推理和答案令牌价格计算,再除以任务数量,并按其智能指数权重加权。人工分析智能指数 v4.1 包含:GDPval-AA v2、𝜏³-银行业、终端基准 v2.1、SciCode、人类的最后考试、GPQA 钻石、CritPt、AA-全知、AA-LCR。有关更多详细信息,请参阅智能指数方法论,包括每项评估的拆解及我们的执行方式。令牌使用每项智能指数任务的输出令牌加权平均数用于运行一项人工分析智能指数任务。推理模型用灯泡图标表示。每项智能指数任务所需的令牌数量。通过将每项评估的输出令牌乘以智能指数中每个基准的相对权重再除以任务数量(不包括重复项)来计算。价格和成本每项智能指数任务的成本每项人工分析智能指数任务的加权平均成本(美元),按令牌类型细分。分数越低越好。推理模型用灯泡图标表示。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡