开放人工智能数学结果的评估
Hacker News2026年8月1日 17:08
对于普通人来说,很难理解这些任务的复杂性。我不是数学家,对于例如结果3和10之间的区别并不清楚。因此,我让GPT-5.6 Sol Pro和Fable 5 Max使用@EpochAIResearch的OpenMath评分标准进行分类: — “可靠结果”:该领域的强大研究者会很高兴他们的中位数输出能解决这种水平的问题。然而,该问题可能在其子领域之外不会引起太多关注。 — “重大进展”:在广泛的数学领域(例如数论或图论)工作的中位数人会注意到,并可能会花时间了解至少解决方案的大纲。 — “突破性成果”:中位数数学家会想知道这个结果,即使它在他们的领域之外。这可能成为全年所有数学中最佳结果的候选之一 === Fable和Sol一致认为结果3是突破性成果(这也解释了为什么@SebastienBubeck在其推文中以此开头)。他们还一致认为至少有7个是重大进展。Fable认为结果7只是一个可靠结果,而Sol则赋予其“重大进展”标签。还有趣的是,官方的Epoch.AI评分标准指出:> 当多个层级对一个问题似乎合理时,我们会采取保守的方向进行评估。在解决之后将一个问题的重要性降级是令人失望的,而我们总能突出解决方案中任何意外有趣的元素。Fable 5认为至少有3个结果是“临界突破”(结果1、4和9)。@AcerFur对此有何看法
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡