返回

文章详情

GLM-5.3 人工分析基准

Hacker News2026年8月18日 22:06

人工分析智能指数 v4.1.1 包含 9 项评估:GDPval-AA v2,𝜏³-银行,Terminal-Bench v2.1,SciCode,人类的最后考试,GPQA Diamond,CritPt,AA-全知,AA-LCR 推理模型由灯泡图标表示。人工分析智能指数 v4.1.1 包括:GDPval-AA v2,𝜏³-银行,Terminal-Bench v2.1,SciCode,人类的最后考试,GPQA Diamond,CritPt,AA-全知,AA-LCR。有关详细信息,请查看智能指数方法论,包括每项评估的细分和我们的运行方式。人工分析智能指数由开放权重/专有人工分析组成。人工分析智能指数 v4.1.1 包含 9 项评估:GDPval-AA v2,𝜏³-银行,Terminal-Bench v2.1,SciCode,人类的最后考试,GPQA Diamond,CritPt,AA-全知,AA-LCR 推理模型由灯泡图标表示。人工分析智能指数 v4.1.1 包括:GDPval-AA v2,𝜏³-银行,Terminal-Bench v2.1,SciCode,人类的最后考试,GPQA Diamond,CritPt,AA-全知,AA-LCR。有关详细信息,请查看智能指数方法论,包括每项评估的细分和我们的运行方式。指示模型权重是否可用。如果权重可用但商业使用有限(通常需要获得付费许可证),则模型标记为“商业用途受限”。智能评估通过人工分析独立测量的智能评估 · 越高越好代理工具使用推理与知识知识 1 - 幻觉率长上下文推理对电子表格和文档的定量分析推理模型由灯泡图标表示。虽然模型智能通常可以跨用例转换,但特定评估可能与某些用例更相关。人工分析智能指数 v4.1.1 包括:GDPval-AA v2,𝜏³-银行,Terminal-Bench v2.1,SciCode,人类的最后考试,GPQA Diamond,CritPt,AA-全知,AA-LCR。有关详细信息,请查看智能指数方法论,包括每项评估的细分和我们的运行方式。AA-全知AA-全知指数AA-全知指数(越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,没有拒绝回答的惩罚。得分范围为 -100 到 100,其中 0 表示正确答案与错误答案一样多,负分则表示错误答案多于正确答案。推理模型由灯泡图标表示。AA-全知指数(越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,没有拒绝回答的惩罚。得分范围为 -100 到 100,其中 0 表示正确答案与错误答案一样多,负分则表示错误答案多于正确答案。智能指数比较智能指数与每项智能指数任务的成本人工分析智能指数 · 每项人工分析智能指数任务的加权平均成本(美元)最具吸引力的象限Pareto线推理模型由灯泡图标表示。每项智能指数任务的加权平均成本。每项评估的成本由输入、缓存命中、缓存写入、推理和答案令牌价格计算,再除以任务数量,并按其智能指数权重加权。人工分析智能指数 v4.1.1 包括:GDPval-AA v2,𝜏³-银行,Terminal-Bench v2.1,SciCode,人类的最后考试,GPQA Diamond,CritPt,AA-全知,AA-LCR。有关详细信息,请查看智能指数方法论,包括每项评估的细分和我们的运行方式。令牌使用输出令牌每项智能指数任务的加权平均输出令牌数使用的令牌数推理模型由灯泡图标表示。每项智能指数任务所需的令牌数。这是通过将每项评估的输出令牌乘以智能指数中每个基准的相对权重,然后除以任务数量(不计算重复)计算的。成本每项智能指数任务的成本每项人工分析智能指数任务的加权平均成本(美元),按令牌类型细分。越低越好推理模型由灯泡图标表示。每项智能指数任务的加权平均成本。每项评估的成本由输入、缓存命中、缓存写入、推理和答案令牌价格计算,再除以任务数量,并按其智能指数权重加权。运行人工分析智能指数的成本(美元)运行人工分析智能指数中所有评估的成本推理模型由灯泡图标表示。计算运行人工分析智能指数中评估的成本,使用模型的输入、缓存命中、缓存写入、推理和答案令牌定价以及在所有评估中使用的令牌数量。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡