GLM-5.3-闪光智能、性能与价格分析
人工智能分析智能指数人工分析智能指数v4.1.1包含9项评估:GDPval-AA v2、𝜏³-银行、Terminal-Bench v2.1、SciCode、人类的最后考试、GPQA Diamond、CritPt、AA-全知、AA-LCR 理性模型用灯泡图标表示。人工分析智能指数v4.1.1包括:GDPval-AA v2、𝜏³-银行、Terminal-Bench v2.1、SciCode、人类的最后考试、GPQA Diamond、CritPt、AA-全知、AA-LCR。有关更多详细信息,请参见智能指数方法论,包括每项评估的细分及其运行方式。人工分析智能指数由开放权重/专有人工分析智能指数v4.1.1包含9项评估:GDPval-AA v2、𝜏³-银行、Terminal-Bench v2.1、SciCode、人类的最后考试、GPQA Diamond、CritPt、AA-全知、AA-LCR。有关更多详细信息,请参见智能指数方法论,包括每项评估的细分及其运行方式。指示模型权重是否可用。如果商业使用有限条件,模型标记为“商业使用受限”,如果许可证禁止商业使用,则标记为“非商业”。智能评估智能评估由人工分析独立测量·越高越好代理工具使用推理与知识知识1 - 幻觉率长上下文推理电子表格与文档的定量分析推理模型用灯泡图标表示。虽然模型智能通常跨用例适用,但某些评估对特定用例可能更相关。人工分析智能指数v4.1.1包括:GDPval-AA v2、𝜏³-银行、Terminal-Bench v2.1、SciCode、人类的最后考试、GPQA Diamond、CritPt、AA-全知、AA-LCR。有关更多详细信息,请参见智能指数方法论,包括每项评估的细分及其运行方式。AA-全知AA-全知指数AA-全知指数(越高越好)测量知识可靠性与幻觉。它奖励正确答案,惩罚幻觉,不惩罚拒绝回答。得分范围从-100到100,其中0表示正确答案与错误答案一样多,负分表示错误答案多于正确答案。推理模型用灯泡图标表示AA-全知指数(越高越好)测量知识可靠性与幻觉。它奖励正确答案,惩罚幻觉,不惩罚拒绝回答。得分范围从-100到100,其中0表示正确答案与错误答案一样多,负分表示错误答案多于正确答案。智能指数比较智能指数与每个智能指数任务的成本人工分析智能指数·每个人工分析智能指数任务的加权平均成本(美元)最具吸引力的象限帕累托线推理模型用灯泡图标表示每个智能指数任务的加权平均成本。每项评估的成本从输入、缓存命中、缓存写入、推理和答案代币价格计算,除以任务数量,并按其智能指数权重加权。人工分析智能指数v4.1.1包括:GDPval-AA v2、𝜏³-银行、Terminal-Bench v2.1、SciCode、人类的最后考试、GPQA Diamond、CritPt、AA-全知、AA-LCR。有关更多详细信息,请参见智能指数方法论,包括每项评估的细分及其运行方式。代币使用每个智能指数任务的输出代币每个智能指数任务使用的加权平均输出代币数。推理模型用灯泡图标表示每个智能指数任务所需的代币数量。通过将每个评估的输出代币乘以智能指数中每个基准的相对权重,再除以任务数量(不包括重复项)进行计算。成本每个智能指数任务的成本每个人工分析智能指数任务的加权平均成本(美元),按代币类型细分。越低越好推理模型用灯泡图标表示每个智能指数任务的加权平均成本。每项评估的成本从输入、缓存命中、缓存写入、推理和答案代币价格计算,除以任务数量,并按其智能指数权重加权。运行人工分析智能指数的成本(美元)运行人工分析智能指数中所有评估的成本。推理模型用灯泡图标表示运行人工分析智能指数中的评估的成本,使用模型的输入、缓存命中、缓存写入、推理和答案代币价格及所使用的代币数量进行计算。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡