人工智能代理正在检查科学文献——并发现数十年前的错误
一个AI事实检查工具在化学参考数据库中发现了分子沸点的错误。信用:Monty Rakusen/Getty 多年来,化学家们依赖手册中的分子沸点值来识别物质和规划如蒸馏等过程。但是,一个人工智能模型揭示了某些在一个参考数据库中的受信数字一直是错误的。中国杭州的浙江实验室理论化学家Sebastian Pios正在使用一个AI系统预测几个分子的沸点时,发现生成的数值与一个历经75年的参考数据库中的长期被接受条目相冲突。起初,他以为模型是错的。但当他手动检查原始文献时,发现参考数据是错误的,而不是AI模型。在其他两个案例中,Pios的AI模型发现了旧论文和参考书中的错误——这些错误已经进入科学经典。一是论文中的印刷错误;另一个是一个世纪前的沸点测量的错误值。Pios说,这两个错误可能给使用该数据库的研究人员造成了“很多麻烦”。Pios是越来越多的科学家之一,他们将AI作为审计科学知识的工具。除了检查数据库,研究人员还在使用专业的AI工具去寻找发表在期刊和会议上的论文中的错误。 AI、同行评审和科学的人类活动 在7月22日在线发布的一项分析中,特拉华州的盈利研究审核公司SAI Labs的研究人员使用AI代理评估了168篇被选为2026年国际机器学习会议(ICML)口头报告的论文。AI代理提取了作者的核心主张,下载了随附资源,尽可能重新进行实验,并将结果与作者报告的结果进行比较。在92篇至少有五个主张可供评估的论文中,AI代理仅能从34篇论文中重复五个主张中的超过两个。代理成功重复了仅八篇论文中的超过80%的主张。但是,挪威科技大学的计算机科学家Odd Erik Gundersen表示,这些AI事实检查工具仍然不可靠的科学典籍仲裁者。他表示,这些工具“像人类一样犯错”,这就是为什么AI事实检查者的质量必须在人工监督下手动处理。 AI事实检查器 许多研究人员已经将时间奉献给发现论文中的错误,并使用工具检查论文的某些方面。但斯坦福大学计算机科学家James Zou表示,使用AI的一个优点是与人类相比,它可以多快扫描科学数据库和文献。“最大区别在于能够以以前无法达到的规模做到这一点。”在预印本服务器arXiv上发布的一项研究中,Zou和他的同事使用‘AI检查器’扫描发布在NeurIPS上的论文——这是一个享有声望的年度AI研究会议——以查找错误。他们的工具发现,论文中的错误从2021年的3.8个上升到2025年的5.9个——增加了55%。 AI工具正在发现研究论文中的错误:内部正在增长的运动 “这些是已经发表的论文,因此它们在某种程度上被视为下一代研究的基础知识,”Zou说。“如果这些基础上有错误,这可能会传播并使后续研究变得更加不稳。”他补充道。该分析集中在“客观”错误上,例如公式、计算和图表中的错误,排除了关于数据解释和新颖性的主观错误。合著者、位于加利福尼亚旧金山的机器学习科学家Federico Bianchi表示,这是一个设计选择。“AI不应做所有事情,而应将新颖性和重要性的选择留给人类,”他说。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡