返回

文章详情

蒂姆·高尔斯:大型语言模型擅长什么样的数学?

Hacker News2026年8月12日 10:04

为了便利未来可能阅读这篇博客的任何人(比如说一个月后),我想提到我是在OpenAI宣布其解决了数学和理论计算机科学中的十个重大问题的几天后写的这篇文章,这些问题包括第一个非索菲克群的构造,以及对多色拉姆齐数的证明(其中包含3)在某种意义上是超指数性的。根据我参加过的各种讲座判断,第一个问题是群论中最重要的未解决问题之一,而第二个问题则是拉姆齐理论中的一个重大开放问题,我并不指望在我有生之年看到其被解决,尽管当然,现在的期望不得不被调整。我希望明确时间点的原因在于,我将讨论大型语言模型(LLMs)目前的能力,完全预期这些能力将继续快速变化。因此,在不久的将来,如果我所写的内容有任何有趣的地方,它主要会有趣于作为2026年8月初时情况的记录。这些结果以及名单上的其他八个结果都极其令人印象深刻,但到目前为止似乎并不是说LLMs在所有数学方面都优于所有人类。如果是这样,那么它们相对于我们的大速度优势将意味着将会有更多的结果涌现。因此,想知道LLMs擅长什么样的问题,以及哪些地方还有改进的空间是很自然的。我并不假装有一个好的答案来回答这个问题,一个好的答案应该是能够很好地适应当前例子的清晰分类,但尝试排除一些糟糕的答案,以及确定那些不明显被证据否定的潜在答案是一个有趣的练习。LLMs是否特别擅长寻找反例?这里的第一点是,LLMs不仅擅长寻找反例:它们也可以找到困难命题的证明。然而,值得注意的是,它们解决的大多数著名问题几乎都是提供反例而非证明。上面提到的两个问题是如此,雅可比猜想和单位距离猜想也是如此。如果人们想理论化LLMs特别擅长寻找反例,那么有两件事情可以做来使理论更具说服力。第一听起来似乎没有问题:决定何时解决一个问题算作找到一个反例。一旦解决了这个问题,第二步是提出一个潜在的解释,说明为什么LLMs特别适合解决这类问题。找到反例是什么意思?为什么我会建议寻找反例的含义并不完全显而易见?当然,人们可能会提出,其实这仅意味着你有一个形式为“每个这样的类型的对象都有这样的属性”的命题,而你展示了一个没有该属性的给定类型的对象。然而,这并不总是有效。考虑维诺格拉多夫的一个著名结果,该结果指出每个足够大的正整数都是三个素数的和。这个命题的否定是(或等价于)“对于每个正整数存在一个整数,使其不是三个素数之和”的命题。换句话说,它指出每个正整数都有某种属性。以这种方式来看,维诺格拉多夫找到了一个没有该属性的正整数。我们要说维诺格拉多夫找到了一个反例吗?显然不是——这个结果显然应当被归类为定理而不是反例。因此,我们不能简单天真地说LLMs特别擅长否定普遍量化语句:关于普遍量化的性质必须要有一些东西。在这个三素数的例子中,显然维诺格拉多夫并没有想,“我该如何找出具有这个属性的实例?”而是他可能更像是在想,“我有一个非常大的整数。我该如何证明它是三个素数的和?”换句话说,他的所有焦点都应该集中在普遍量化的方面,而存在量化的则是在证明细节处理完之后的一个想法。一般来说,许多有趣的结果在正式陈述时开始于两个或三个(或更多)量词的交替。因此,问题变成了确定哪个是某种意义上第一个“有趣”的量化变量。再给出另一个例子来说明这一点,来自有限维诺尔德空间理论。我会给出一些数学细节供感兴趣的人参考,但如果你不在意这些,你可以跳过接下来的三段,并能理解我对这个例子的看法。设为两个二维诺尔德空间,设b

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡