这个人工智能工具声称可以挑选出前1%的预印本。研究人员应该信任它吗?
QED科技公司开发了一种人工智能工具,用于在出版前检查手稿,并评估其发现的原创性和有效性。图片来源:deepblue4you/Getty 越来越多的私营公司为研究人员提供人工智能工具,以便在出版前仔细审查手稿。一种由位于以色列特拉维夫的初创公司QED科技开发的系统,旨在判断生命科学研究是否原创且有效。QED科技的工具经过训练,以评估给定手稿中的主张是否得到所呈现数据的支持,并识别工作中的漏洞。该工具对研究人员免费提供,迄今为止已在70多个国家的1500个机构中被超过10,000个实验室使用。 去年11月,开源预印本平台openRxiv(运营bioRxiv和medRxiv的非营利组织)宣布将在bioRxiv上试点QED科技系统。在6月份发布的一项分析中,QED科技利用该工具对2025年5月至2026年4月期间在bioRxiv上发布的57,000多篇预印本进行排名,并选择了“前1%”。但这种排名在研究人员中引发了争议,有人认为这可能会创造另一个声望标签,并强化学术界基于指标的文化。还有人对人工智能以可靠和透明的方式评估科学研究的质量能力表示怀疑。《自然》与QED科技的联合创始人兼首席执行官Niv Mastboim进行了交谈。 Niv Mastboim共同创立了人工智能公司QED科技,该公司开发了一种衡量科学手稿质量的指标。图片来源:Itay Rokban QED科技的人工智能平台如何评估给定文章中的科学主张?有很多工具可以审查研究文章。我们的做法略有不同,在几个方面。我们在多个数据源上训练了人工智能平台,从开放审阅和用户反馈到合成数据。一个要素是建立实验的负面结果——这些结果不支持正在测试的原假设或结论。出版的文献过于偏重成功和积极的发现。要正确评估科学主张,系统还需要了解不支持主张的证据是什么样子。这可以通过已发布的无效或矛盾发现、失败的复制研究以及其他非支持性证据来学习。我们专注于为系统创建内部指标,以便不断改进。因此,系统验证论文中每个主张,并为其附加分数。我们使用多种评分,从原创性到有效性。人工智能平台完全自主,但我们也有很多用户给我们反馈。我们利用这些反馈不断调整工具。 前1%的列表旨在服务的目的是什么? 目标是根据工作的本身而不是期刊或作者的声望来评判科学。1%的574篇预印本是57,455篇评估中bioRxiv预印本中的高分作品。它们是完全根据QED对原创性和有效性的评估进行选择的,而与作者身份、机构或出版场所无关。我们还旨在识别当前出版系统遗漏的精彩论文。我们进行了单独的验证分析,涉及2025年4月的2,879篇bioRxiv预印本,这些论文随后在同行评审的期刊中发表,然后我们将工具的排名与期刊排名进行基准比较。在该分析中,QED对这些论文的评价高于它们最终出版的期刊可能的表明,比例为12.9%。我们称这些文章为“隐藏的宝石”。我们咨询了一组专家,以盲法评判最强的争议案例,发现他们在75%的决定性比较中更倾向于QED推荐的论文。 该工具是最终的“同行评审者”吗?你认为将来出版商会使用它吗? 我们并没有向期刊或出版商提供我们的产品。我们的目标是为作者在私密、安全的环境中提供免费服务,让他们在发表前改进工作。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡