AI 模型在这些智力测试中失误。你能做得更好吗?
谜题和游戏可以揭示模型智能中的差距。尝试这七个测试,看看你是否能胜过 AI。文森特·基尔布莱德。自从一开始,谜题和游戏就是 AI 发展的核心。就像我们人类喜欢通过填字游戏或逻辑难题来测试自己的智力一样,开发者可以通过游戏考验模型的进步程度。'机器学习'这一术语是在 1959 年由 IBM 计算机科学家亚瑟·塞缪尔在一篇文章中普及的,文章关于一种学习下棋的算法。国际象棋和中国围棋也是著名的 AI 测试基地。从仅仅是解谜的能力来看,AI 正在快速进步。到 2024 年底,哥伦比亚大学的一组科学家表明,即使是最好的模型也只能解决出名的《纽约时报》 Connections 谜题的 18%;到 2025 年初,一些模型几乎每次都能完美解决它们。但谜题不仅仅突出 AI 能力的不可忽视的进步。观察模型在哪些方面成功与失败——以及我们人类在哪些方面仍然胜过它们——可以提供一扇有用的窗口,看到这项技术的优点与缺点。尽管取得了进展,今天的模型仍然会出现错误:经典谜语中的微妙变化常常让它们受挫,而视觉谜题是一个特别大的弱点。在这里,你将有机会在那些曾经难倒模型的谜题上测试你的智力。有些对你来说可能和 AI 一样棘手;其他一些可能简单到让你怀疑 AI 是否真的智能。每一个谜题都突出表现了机器和人类认知的差异。如果你在测试中表现出色,你将证明你可以在解谜上胜过 AI——至少在目前这个阶段。空间推理。让我们从一个人类拥有巨大优势的领域开始:空间推理。如果你曾经参加过 IQ 测试,你可能会遇到过一个心理旋转问题。这些谜题要求你确定不同的图像是否表示从不同角度看相同的物体。尽管今天的语言模型通常具备分析视觉输入的能力,但它们仍然在这些谜题上表现得非常糟糕。尽管谈到世界模型如何帮助 AI 理解物理环境,但大型语言模型似乎仍然无法像空间思维者(例如建筑师和机械工程师)那样操控三维物体。心理旋转说明:选择一个以不同角度显示提示中对象的答案。在每种情况下,只有一个正确答案!记忆与适应。前沿大型语言模型具有非凡的记忆能力;它们在训练中接触到大量事实,并能够忠实地复述其中许多。这对在智力竞赛中超越人类是一个资产,但也可能成为一个负担。当一个谜题与模型在训练期间见过的谜题相似时,模型可能会忽略关键差异而回应其所记住的答案。在 2024 年的一项研究中,谷歌和伊利诺伊大学香槟分校的研究人员对经典谜题的轻微变体进行了培训和测试,这种谜题被称为骑士与骗子。在这些问题中,一些角色总是说真话,而另一些则总是撒谎,你必须弄清楚谁是谁。同样的原理可能在一个叫做 SimpleBench 的测试中起作用。这些问题与模型在训练中可能Encountered 的更复杂的问题相似。人类能发现其中的窍门,但即使是顶级模型也会绊倒。骑士与骗子说明:解决这些谜题你需要知道的唯一一点是骑士总是说真话,而骗子总是撒谎。根据每个角色所说的话来判断他们是谁。1 你遇到了一组两个岛民。他们的名字是爱德华和华莱士。华莱士说:爱德华说真话。爱德华说:华莱士和我属于同一类型。 2 你遇到了一组三个岛民。他们的名字是约瑟夫、弗朗辛和爱丽丝。弗朗辛说:约瑟夫是骗子。弗朗辛说:爱丽丝说真话。爱丽丝说:约瑟夫不是我的类型。 3 你遇到了一组三个岛民。他们的名字是罗伯特、文森特和米歇尔。米歇尔说:罗伯特总是撒谎。文森特说:米歇尔是诚实的。罗伯特说:文森特不诚实。罗伯特说:文森特不是我的类型。SimpleBench 说明:仔细阅读这些简单的 Bench 问题,你应该能很快找到答案。1 贝丝在第一分钟开始时将四个完整的冰块放入煎锅,然后在第二分钟开始时放入五个,在第三分钟开始时放入一些,但在第四分钟时没有放入。如果煎锅在煎鸡蛋时平均每分钟放入的冰块数量是五个,那么在第三分钟结束时,煎锅中可以找到多少个完整的冰块?2 一个杂技演员将一个坚固的蓝色球扔到一米高,然后将一个坚固的紫色球(大小相同)扔到两米高。然后,她小心地爬上一架高高的梯子,平衡着一个黄色的气球在头顶上。紫色球在哪里?
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡