我为两个伪造作者的研究论文标记了,并且这两个论文都被接受为口头报告
在我们二人之间,我们在这个夏天审查了22份论文提交,分布在NeurIPS、WACV和TerraBytes(ECCV的一个地理空间研讨会)中。这22篇论文中有15篇(68%)包含完全伪造的引用、存在论文的伪造作者列表和/或明显是LLM生成的(例如,虚构的技术术语、荒谬的写作、不相关的引用)。这被称为身处“垃圾战壕”(即处理AI垃圾炮的输出)。在这里,我们抱怨这主要是浪费时间,进行了一小段对LLM在科学写作和审稿中现状的文献回顾,让Claude生成了一些问答问题,并发布了Isaac制作的文献审计技能。下表显示了伪造引用、伪造作者或明显是LLM生成的写作的审查任务数量,占该场地总任务的比例。场地 Caleb Isaac NeurIPS(数据集和基准跟踪) 2/5 NeurIPS(立场论文跟踪) 2/2 TerraBytes(ECCV研讨会) 1/2 4/5 WACV 3/4 3/4 总计 6/11(55%) 9/11(82%) 我们显然不是唯一在垃圾战壕中的人。过去一年,这个问题的规模以各种方式被测量。Nature在四月的分析发现,至少有数以万计的2025年出版物“可能”包含无效的AI生成引用。赵等人对arXiv、bioRxiv、SSRN和PubMed Central的审计估计,仅2025年就有约146,900个虚构的引用,分散在许多论文中,而不是集中在几个不良作者中,早期职业研究者和小团队最可能包含它们。他们还发现审稿人未能抓住这些问题——他们追踪含有虚构引用的bioRxiv预印本及其已发布版本,发现85.3%的虚构引用依然存在。一项覆盖250万篇生物医学论文的《柳叶刀》审计发现,至少有一个伪造引用的论文的比例在两年内增加了六倍,从2023年的每2828篇论文中有一篇,增加到2025年的每458篇,2026年初增加到每277篇。Ansari(2026)对从2025年NeurIPS实际发表的论文中提取的100个虚构引用进行分析。这些引用中的每一个都通过了三到五位专家评审,带有这些引用的53篇论文,约占接受论文的1%,今天仍在会议记录中。垃圾也是双向流动的。Pangram(一家有AI写作检测产品的公司)对2026年ICLR的评审进行了分析,发现21%的评审(15,899篇!)是完全由AI生成的,超过一半的评审有某种形式的AI参与。Gartenberg等(2026)测量到自ChatGPT发布以来,对《组织科学》期刊提交的数量增加了42%,并发现现在超过30%的同行评审使用某种程度的AI。ICML 2026在提交中隐藏了提示注入的钓鱼,发现“795份评审(约1%的所有评审)由506位被分配政策A(不允许LLM)的独特评审员撰写,被检测到在评审中使用了LLM”。现在,随着NeurIPS评审的公布和反驳的到来,我们看到了一份明显的AI生成的伦理审查和几份明显的AI生成的反驳。这是一个问题,原因有很多,其中之一是AI评审员可以被直接操控——Li等(2026)发现,经过对抗性改写的摘要在审稿时提高了AI生成的评审结果,“而不改变论文的基础科学内容和交流,甚至没有对审稿模型的知识。”他们的最强攻击成功率约为38%,在10分制上,使Gemini 3 Flash评审员的接受率提高了+1.31,GPT 5.4 Mini评审员提高了+0.88。这一切在审稿队列中令人非常恼火。同行评审是我们进行的无偿工作(通常是在晚上和周末),因为对我们自己工作的同行评审是如此有价值。花几个小时审查一份提交,然后发现存在虚构引用,这令人愤怒,因为这是浪费我们的时间!如果你连引用都没花足够的时间去核对,那么a.) 我们为什么要花时间为你审稿,b.) 你希望通过提交达到什么目的?从评审中学习需要反思你的工作,而你需要花时间在你的工作上才能做到这一点。你这个夏天审查了多少论文,有多少论文仅仅因为引用问题就会被你直接拒绝?Caleb:11篇(见上表)。其中五篇有虚构的作者和/或整个论文出现在参考文献中。在WACV的两个提交中,参考文献[1],在参考文献中的第一个条目,列出了真实论文的虚构作者。一个NeurIPS的论文中有如此多的虚构/荒谬的术语(53页),以至于没有必要去查阅参考文献。Isaac:也是11篇:两篇NeurIPS立场论文、五篇TerraBytes和四篇WACV。我的九篇...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡