人工智能推理是否出于错误的原因?
我只想说:人工智能“推理”到底发生了什么?对不起,使用引号。这种标点的侧眼在2024年更为常见,当时被称为“大型推理模型”的LLM的特别训练亲戚依然较新。如今,这似乎显得有些无礼,因为OpenAI的“通用推理模型”在2026年5月一举解决了一个著名的开放数学研究问题。但我仍然不确定该如何其他方式承认我对这些AI系统实际所做科学解读的智力鞭策。推理有许多技术定义的形式,但基本步骤很容易识别:通过将逻辑上相互关联的中间步骤联系起来得出一个合理的结论。我们通过思想进行推理;LRM使用所谓的思维链,这是模型在得出复杂查询答案之前发出的合成文本流的一种艺术术语。此前,Apple的一个研究团队就曾严肃且可信地批评,认为AI通过这些链进行推理是“思考的幻觉”,在意想不到的简单条件下会导致“完全准确崩溃”。但下一分钟,LRM在国际数学奥林匹克中摘得金牌,这项成就如此具有挑战性,以至于“即使是非常成功的数学家和科学家也可能在一生中强调这一点”,正如科学家和AI评论家Gary Marcus与Ernest Davis在2025年所写。如果这不是“真实”推理的标志,那还有什么?但等一下——不久之后,圣菲研究所的更多研究显示LRM能够利用仅仅是“表面级别的‘捷径’”来击败甚至精心设计的推理基准(如一系列类比视觉难题)。他们的行为看起来更像是操弄系统,而不是一般性的推理。然后,好像按下了暂停键一样,出现了另一个“让我看看”的时刻:谷歌DeepMind和数学家陶哲轩(天才!)利用AI重新发现或改进了67个“涉及数学分析、组合学、几何和数论的问题”的解决方案。得接受这一现实吧,仇恨者们!关于LRM即使具备所需算法和计算预算也无法可靠推理的额外证据又如何呢?它们还遭受了科学文档记录的失败状态长长的清单,简直可以滑梯般使用。随便吧——我想这就是“锋利的智能”对你们的定义(AI术语,即“当有效时,它会有效”)。事情就这样从2025年底上演到2026年。作为一名科学记者,我干了20年,其中一半是AI记者,所以我知道不该期待快速进展的研究能有整齐的一致性。但即使对于我来说,这种反复无常也有些过头了。引用阿尔·帕西诺在《内幕者》中的话:“我感受到两种情绪:恼怒和好奇。”我不相信这里存在欺诈。我只想知道到底是怎么回事。人工智能推理是否可以同时是虚妄又不是虚妄?如果可以,这到底是怎么工作的?我知道该打给谁。梅兰妮·米切尔的人工智能生涯可以追溯到1980年代,但最近,她以当代AI真相揭示者的身份赢得了声誉,为《科学》和她广受欢迎的新闻通讯撰写清晰的解释,并在圣菲研究所开展研究。(关于“表面级别的‘捷径’”的研究是她的。)当我问她我们实际上对AI推理知道多少时,她的回答简洁到可以写在便签纸上。“第一点:它有效。它改善事物,”她说,指的是LRM在推理任务上的精确度优于LLM。“第二点:生成的实际文本”——即每个LRM被训练以产生以提高其性能的思维链——“不一定忠实于[模型内部]发生的事情。第三点:很多文本甚至都没用。实际上可以把它们去掉。”让我们分解一下第二点和第三点,因为这才是“虚妄与非虚妄”超位置真正存在的地方。思维链在2022年半发现、半设计,作为LLM的提示技巧:给它们提供书面推理的例子(或者,著名地,仅仅是要求它们“逐步思考”),它们就会突然对简单的逻辑和数学问题给出更少的愚蠢答案。LRM从2024年开始使用OpenAI的o1模型,训练这些提示以生成这样的文本——也称为推理轨迹或思维标记——然后反馈给自己。因为LRM本质上只是语言模型,所以那些额外的文本片段创造了看似令人信服的模型“思维过程”的纸质轨迹。除非问题并没有那么简单。越来越多的学术和行业研究对这些“中间标记”是否忠实反映LRM的内部运作产生了怀疑。它们看起来不再是可审计的收据或准确的报告,而更像是Ari所描述的那种……
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡