SpaceXAI的Grok 4.6在人工分析智能指数上得分61
SpaceXAI的Grok 4.6在人工分析智能指数上得分61,跻身于与GPT-5.6 Sol齐名的前沿,展现出卓越的智能性能,同时成本更低。Grok 4.6在发布后仅一个多月内在智能指数上较Grok 4.5提升了5分,较Grok 4.3提升了23分。这将SpaceXAI带回了智能前沿,仅次于Anthropic。主要要点: ➤ Grok 4.6加入了人工分析智能指数的前沿:得分61,与GPT-5.6 Sol(最高)并列,在Claude Opus 5(最高,63)和Claude Fable 5(最高备份,62)之后,领先于Kimi K3 ➤ 强大的智能表现:Grok 4.6的GDPval-AA v2 Elo得分为1753,仅次于Claude Opus 5,与Claude Fable 5和Qwen3.8 Max存在重叠的置信区间。在𝜏³-Banking中得分50.7%,与Qwen3.8 Max(51.3%)并列为前两名得分,并在Terminal-Bench v2.1中得分88.4%,与领先模型持平 ➤ 以更低的成本实现前沿级智能:Headline定价与Grok 4.5保持不变,为每百万输入/输出Token 2美元/6美元,低于Claude Opus 5(5美元/25美元)和GPT-5.6 Sol(5美元/30美元)60%以上。每个任务的成本为0.84美元,与Kimi K3相同但智能略高,将其置于智能与每任务成本的帕累托前沿 ➤ Grok 4.6在AA-Briefcase的表现相当于Fable 5级别,这是我们针对长期智能知识工作的私有基准,Elo为1577,落后于Claude Opus 5系列。它的效率显著,平均大约53轮和0.5B输入tokens就完成任务,而Claude Opus 5(最高)需约103轮和2.0B输入tokens。其他模型细节: ➤ 上下文窗口为500k tokens(与Grok 4.5保持不变) ➤ 输入/输出每百万tokens定价为2美元/6美元;缓存命中折扣至每百万tokens 0.5美元,比Grok 4.5的每百万tokens 0.3美元有所上升。智能表现Grok 4.6在智能工作方面取得的最好结果,而不是静态推理。根据我们的领先评估真实世界智能知识工作的GDPval-AA v2,它的Elo得分为1753,仅次于Claude Opus 5,且与Claude Fable 5及Qwen3.8 Max在统计上不可区分。在各类任务中,这一趋势得以保持。𝜏³-Banking(50.7%)测试多轮客户服务及工具使用,使Grok 4.6进入前两名,而Terminal-Bench v2.1(88.4%)使其在基于终端的软件任务上达到与领先者同等的水平。极少有模型能够在知识工作、客户服务及终端使用三者间同时具有竞争力;结合其定价,这使得Grok 4.6在智能指数的每一项智能评估中处于成本与表现的帕累托前沿。成本在智能前沿,保持不同代之间的Headline定价不变是非常罕见的,通常智能的提升伴随着价格的上涨。Grok 4.6在保持每百万tokens 2美元/6美元的定价下,实现了5分的智能指数提升,我们测得每任务的成本0.84美元,反映了这一定价和合理的token效率。对买家而言,重要的比较是与得分在其两分之内的模型:Claude Opus 5的定价为5美元/25美元和GPT-5.6 Sol的定价为5美元/30美元。Grok 4.6提供了与GPT-5.6 Sol相同的智能指数得分,但输出token价格仅为其一部分,这在推理密集型工作量中是主导成本的维度。长期智能工作Grok 4.6在AA-Briefcase上首次亮相,这是我们私有的长期智能知识工作基准,Elo为1577。这使得它位于Fable 5级别,落后于Claude Opus 5系列,在评分、展示质量和分析质量上表现一致优异,而不是在一个维度上的强度抵消另一个维度的弱点。效率特性与得分同样引人注目。Grok 4.6平均用约53轮和0.5B输入tokens解决任务,而Claude Opus 5(最高)需约103轮和2.0B输入tokens。长期智能工作迅速积累上下文,因此,一个在一半的回合和四分之一的输入tokens内达到相应答案的模型,成本优势远超其每token定价。完整结果有关人工分析智能指数中各个评估的完整细分:请查看人工分析以获取更多关于Grok 4.6的详细资料和基准:https://artificialanalysis.ai/models/grok-4-6
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡