ARC-AGI 排行榜
Hacker News2026年7月25日 06:31
ARC-AGI-1 ARC-AGI-2 ARC-AGI-3 作者:所有作者 模型类型:所有类型 模型:所有模型 理解排行榜 ARC-AGI 从其最初的版本(ARC-AGI-1 和 2)发展而来,这些版本测量的是被动流体智力,而 ARC-AGI-3 则挑战 AI 代理在新互动环境中即时适应。上面的散点图可视化了每个任务成本与性能之间的关键关系——这是效率的关键衡量标准。真正的智力不仅在于解决问题,还在于以最小的资源高效地解决问题。 解读数据 推理系统趋势线解决方案展示了代表同一模型在不同推理水平下的连接点。这些趋势线说明了推理时间的增加如何影响性能,通常会随着思考时间的增加而显示渐近行为。基本 LLMs 解决方案代表了来自标准语言模型(如 GPT-4.5 和 Claude 3.7)的单次推理,没有扩展的推理能力。这些点展示了不带附加推理增强的原始模型性能。Kaggle 系统解决方案展示了来自 Kaggle 挑战的比赛级提交,严格遵循计算限制($50 计算预算用于 120 个评估任务)。这些代表专门设计的高效方法,特别为 ARC 奖设立。 验证政策 如需更多信息,请参见我们的测试政策。 排行榜细分说明 仅显示运行成本低于 $10,000 的系统。对于未能产生完整测试输出的模型,剩余任务标记为不正确。标记为“预览”的结果为非官方,并可能基于不完整的测试。1 ARC-AGI-2 分数估计基于部分测试结果和 o1-pro 定价。2 暂定成本估计基于 Gemini 3 Pro 定价。模型将在发布后重新测试。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡