返回

文章详情

大型语言模型依然有毒,停滞不前,数学能力差

Hacker News2026年7月24日 12:51

自从 ChatGPT 发布已经近四年了。对我们大多数人来说,第一次接触的是 GPT-3.5,遇到的摩擦足以让很多开发者相信,这个东西并不是为处理代码而构建的。幻觉率很高,投诉集中在四个问题上:AI 的数学能力差;AI 停滞在过去;AI 记忆窗口短;AI 有毒,反映了互联网最糟糕的一面。看看当时人们的看法。这些问题在过去几年里都得到解决了吗?这就是为什么这项技术突然变得如此有用吗?并不是。这些问题在最新模型中依然存在。有些有解决方法,另一些则有办法限制它们的出现频率,但每一个问题仍然存在于模型中。作为开发者经历这一切感觉很奇怪。工具时好时坏。有些日子它们确实节省了我的时间,而其他日子则只让我增加了工作量,我永远不知道会得到什么。然后在 2026 年 1 月,处于 Claude Code 的巅峰,我的很多信息源都是人们意识到一个智能体可以为他们写代码。底层模型并没有太大变化,但周围的工具终于赶上了。这值得我们放慢速度去思考。追逐每一个新工具意味着重新学习一些一年后可能不重要的东西。首先是智能体群体,然后是循环,再然后是图形,以此类推。与此同时,四个底层限制没有变,每个值得知道的技巧都是这些限制的解决方法。了解限制,其他的新闻周期就开始自然而然地有了道理。AI 的数学能力差 首先,AI 的数学能力差,而解决方案只是一个变通方法。如果你直接通过 Fable 或 Sol 等新前沿模型的 API 输入一批数学公式,而不是通过它们的原生应用程序,你仍然会看到它们错过了一些你发出的公式。我给 GPT Sol High 发了 200 个简单的加法问题,它错了一个。让这样的 AI 负责你公司的会计,它每几百项交易就会搞错一笔。这里是它错过的那一道题:35653046 + 16814852 模型回答 52467998 精确答案 52467898 那它为什么会错呢?当你问 AI 一个简单的方程比如 1 + 1 时,它能答对,因为这个答案在它的训练数据中。但如果给它一个随机的、较长的数对,比如 35653046 + 16814852,可能这个确切的方程从来没有出现过。没有可以依赖的记忆答案时,模型只会做它所知道的事情。语言模型只会预测下一个可能的标记,因此它从未真正进行计算。它最终模仿小学时的标准算法,逐位处理。但它每一位仍然是根据统计上看起来可能的答案来选择,而不是实际计算。在我们的案例中,这就是它错过的地方,写下了一个错误的数字。这种逐步解题的方式让它成为了一个推理模型。在回答之前,它将一个困难的问题简化为一系列可以处理的简单问题,这就是上面的计算得到 199 个正确答案的原因。这是一个真实的飞跃,但每一步仍然是一种猜测,因此它从未真正达到保证。然而将同样的问题抛给 ChatGPT 或 Claude 时,它却能答对。模型外部的某种东西在介入。应用程序通过将问题交给外部工具来绕过模型的数学弱点。当它注意到一个困难的数学问题时,它会将数字发送到运行 Python 的服务器,让一个小脚本来进行计算,而不是由模型来计算。包裹在模型周围的这个工具称为“套件”。套件就是运行在 AI 周围的代码。可以是各种各样的东西,但在这里,它是捕捉数学问题并调用 Python 脚本的部分。下面是它的工作原理。要看到这一点的实际运作,看看你的 ChatGPT 或 Claude 应用程序如何处理数学提示。如果答案简单到足以在其训练数据中,模型直接响应。如果问题难一些,它首先尝试用标准算法自己解决。当数学变得复杂到无法依赖其中任何一个时,它会暂停,使用 Python 工具进行计算,得到精确答案。模型经过训练来判断这三条路径中哪一条最适合眼前的问题。当它决定需要 Python 工具时,套件就会执行工具调用。整个过程感觉像是有点黑客行为。最终,语言模型仅输出文本。因此,为了使工具调用有效,开发人员训练模型在需要工具时输出特定的 JSON 结构。套件监视模型的输出,发现那个 JSON,运行工具,然后将结果反馈给模型,以便模型能写出最终答案。如果你想知道这看起来是什么样,以上插图详细介绍了原始事件的经过。工具调用在 2023 年左右迅速发展。Meta 的 Toolformer 训练一个模型自行使用工具,比如计算器,而 OpenAI 随后使其变得足够可靠,以便在 ChatGPT 中发布。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡