返回

文章详情

Kimi K3:仅次于 Fable 5 的 AA-Briefcase

Hacker News2026年7月22日 04:33

Kimi K3 在我们的代理知识工作基准 AA-Briefcase 上仅次于 Fable 5,但运行成本超过 Opus 4.8,平均每个任务花费近一个小时。上周 Kimi(Moonshot AI)发布了 Kimi K3,这是一款 2.8T 参数模型,在人工分析智能指数上得分 57,可与 Opus 4.8 和 GPT-5.5 等模型相媲美。在 AA-Briefcase 上,Kimi K3 的 Elo 得分为 1543,比 Kimi K2.6 改进了 727 分,录得的第二高分,仅次于 Claude Fable 5(1574)。AA-Briefcase 是我们新的专有代理知识工作基准,测试模型在数千个复杂输入文件的完全私有数据集上执行现实任务。任务要求交付诸如电子表格、演示文稿和 UI 原型等成果,表现综合为基于正确性、分析质量和展示质量的单一 AA-Briefcase Elo。 Kimi K3 在 AA-Briefcase 上的关键结果: ➤ 仅次于 Fable 5:Kimi K3 在 AA-Briefcase 上实现了 1543 的 Elo,这是第二高的分数,仅次于 GPT-5.6 Sol(最高 1501)、Claude Sonnet 5(最高 1388)和 Claude Opus 4.8(最高 1347)。相较于上一代 Kimi K2.6(816),提升了 727 分,使 Kimi K3 仅次于 Fable 5。 ➤ 客观和分析表现强劲,展示相对较弱:Kimi K3 的评分通过率为 51%,仅次于 Claude Fable 5(56%),优于 Claude Sonnet 5(最高 42.3%)和 GPT-5.6 Sol(最高 41.8%)。它还记录了 1754 的分析质量 Elo,与 Claude Fable 5(1744)相当。展示质量相对较弱,展示 Elo 为 1471,低于 GPT-5.6 Sol(最高 1660)和 Claude Opus 4.8(最高 1492)。 ➤ 每个任务的成本增加约 10 倍:Kimi K3 每个任务的平均成本为 $10.57,使其成为在 AA-Briefcase 上运行的最昂贵模型之一。这是由于模型的令牌定价、输出令牌数量增加和相对较高的回合使用造成的,平均每个任务使用 83 次回合,而 Claude Fable 5 使用 67 次,GPT-5.6 Sol(最高)使用 50 次。Kimi K3 的定价为每百万输入/输出令牌 $3/$15,缓存令牌享有 90% 的折扣。 ➤ 平均每个任务需近一个小时:Kimi K3 在 AA-Briefcase 任务上的平均时间为 56.4 分钟。这是由于回合数量较高,以及更高的输出令牌使用率和使用第一方 Kimi API 时的较低速度所致。Kimi K3 每个任务使用 120k 输出令牌和 83 次回合,而 Kimi K2.6 则为 42k 输出令牌和 54 次回合。这个平均每个任务的时间是 AA-Briefcase 上录得的最高之一,约为 Claude Fable 5 的 2.5 倍和 Grok 4.5(高)水平的 3.8 倍。有关完整的 AA-Briefcase 结果,请访问 https://artificialanalysis.ai/evaluations/aa-briefcase

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡