返回

文章详情

科学文献对大型语言模型是有害的

Hacker News2026年7月29日 15:23

我们想不出有什么文本语料比21世纪的科学文献对有用的大型语言模型的训练更具毒性。可以想象一个二维矩阵,横轴代表诚实与不诚实,纵轴代表正确与错误,科学文献随意地分布在四个象限中。论文往往同时属于多个象限,而这并不总是因为不同作者的贡献。更糟糕的是,任何象限中的论文可能故意伪装成任何其他象限的工作。考虑,例如,普通科学家必须把一个诚实的实验包装在充满夸赞的论文中,并用一个不正确但流行的理论来解释这个实验,以便她能够希望与走廊里的欺诈者竞争,后者可以自由地捏造任何最方便的数据。结果是一个半真半假的地雷区,方便的遗漏和公然的谎言无法与周围的无辜事实和发现区分开来。我们甚至不想谈论写作风格。关于学术文献对大型语言模型表现产生负面影响的实证证据是存在的。2024年,一支由麻省理工学院、康奈尔大学、卡内基梅隆大学、谷歌和OpenAI的研究团队组成的团队研究了在训练后从训练数据中移除不同文本语料对大型语言模型表现的影响(保持大型语言模型的结构不变)。他们发现,移除ArXiv、PhilPapers和NIH ExPorter的训练语料改善了大型语言模型在回答学术问题时的表现,以及在所有基准中的平均表现,同时还减少了模型生成有毒输出的可能性。尽管研究结果并未对此点得出结论,因为移除Pubmed在一定程度上降低了模型性能,但仅仅是大型科学文章的大规模移除(更不用说预处理的错误!)可能改善大型语言模型表现的事实是非常暗示性的。我们想知道这个结果在2026年是否仍然成立,但我们可以打赌,它一定是。科学元数据也没有帮助。一旦作者和引用开始被用作指标,所有信号都被游戏化了。此外,高知名度机构和研究人员也不免于不当行为,任何特定领域也不例外。这对使用AI进行科学研究具有重要的实际意义。人类科学家使用他们的非正式网络来传递声誉信息,通过访问和复制验证工作,并一般地保持关于哪些工作可靠、哪些工作重要的独特个人看法。由于AI代理不参与社会关系,因此它们无法通过人类访问这些社会元数据。这使得科学AI工作面临一系列奇怪的选择。它们可以创建AI代理,让人类科学家进行社交,频繁记录人类科学家的私人环境,或者为科学家创造一个提供稳定流量八卦的激励。或许启动这一努力的一种方法是创造可以让更多科学工作在非正式环境中进行的AI助手。这将意味着监控,但或许为了显著改善我们的生活质量,这也是值得的。我们撰写《重新发明科学》是为了拓宽关于科学和科学资助的对话,我们依赖您帮助我们触及尽可能多的读者。请通过订阅和分享来支持我们的工作。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡