您的模型已经知道答案:基准答案如何泄漏到大型语言模型中
文章 · 2026年7月30日 Francesco Moramarco • Elman联合创始人 AI模型的最佳测试是具有已知答案的现实世界问题。这也是最容易作弊的测试。AI模型已经阅读了大量互联网内容,因此它可能在您提问之前就遇到过您的问题、答案或两者都已。高分隐藏了两种截然不同的情况:一种是通过推理得出答案的模型,另一种是重复其已阅读内容的模型。区分这两者就是污染问题,而这一问题在该领域依赖的许多基准下潜藏着。假设您想知道一个模型在预测某种药物在临床上是否会成功的可靠性。与其等待数年以进行新的试验,不如测试那些已经完成的试验:采取那些已进入临床后期试验的药物项目,隐藏每个药物是否有效,然后要求模型进行预测。从表面上看,这是一次干净的测试,快速且根据真实结果评分,但事实并非如此:值得测试的试验通常是那些著名的试验,其结果在模型训练期间反复出现在教科书、评论、新闻和专利中。当模型说某个药物将成功时,分数无法区分出推理得出答案的模型和认出名称并回忆发生过的事情的模型。临床试验是我们领域中的典型,但这个陷阱是普遍的:任何基于已解决事件的基准都会触发这个陷阱,无论是在金融、法律、预测或任何结果已经公开的地方。这些基准之所以建立在公共历史上,是有充分理由的:真实结果是比任何专家可以想象的更好的测试案例,因为它反映了真正的生物学和药物失败的真实方式,而不仅仅是题目撰写者认为需要问什么。这些结果是我们想要进行评分的金标准,而公开性恰恰是使它们泄漏的原因。那么,我们该怎么办呢?答案泄漏的三种方式 答案通过三条路径到达模型。这个划分是我们组织问题的方式,而不是一种正式的分类,尽管每条路径都有已建立的基础。图1. 三种泄漏并排展示。在每个面板中,红色标记是模型所要预测的答案。输入泄漏在测试时通过模型为当前案例所阅览的文件抵达模型。基准泄漏是您自己的测试文件,在训练数据中被纳入。结果泄漏是公共结果,在训练期间从论文、新闻和专利中学习到的。无论哪条路径,三个答案都是相同的;只有进入的路径不同。输入泄漏发生在测试时,通过模型为当前案例所读的文件,无论您是将这些文件喂给模型还是模型通过搜索工具自行提取这些文件。任何在决策日期之后写的文件都可以宣布模型所要预测的结果,这就好比让它阅读未来(Kaufman等, 2012)。基准泄漏发生在模型在您的基准之后发布,并且模型可能已经在基准数据集上训练,记住了问题和答案。这是基准随时间推移而衰退的最常见方式。Balloccu及其同事追踪了在GPT-3.5和GPT-4发布一年内泄漏的超过四百万个测试样本(Balloccu等, 2024),而当其他研究者从头开始重写一组小学数学题时,几个模型家族在新版本上得分明显较低(GSM1k, Zhang等, 2024)。结果泄漏发生在结果本身是一个公共事实且模型已对其进行训练时:完成的试验、监管批准或某种成功的药物,在成千上万的论文和申请中反复被提及,模型在训练期间吸收了这些信息,无论是在预训练期间还是随后的微调阶段,与您的特定基准没有任何接触。模型以与持有任何其他广为报道的事实相同的方式持有该结果,例如某场战争结束的年份。因此,您可以编写一组全新的测试集,模型从未见过,并且对所有输入进行日期盲处理,但模型仍然会知道这种广为人知的药物是成功的。保持基准的秘密也无济于事,因为答案从未包含在您的文件中;它早已成为模型对世界的普遍知识。等待新的结果有效,直到结果距离现在还有十年 防止任何类型泄漏的最有效方式是完全停止基于历史进行测试,只对尚未发生的事件对模型进行评分,这样就根本没有答案可以泄漏。实时基准在固定的时间表上刷新其问题(LiveBench,White等,2024),而预测基准(如ForecastBench)对那些在测试时尚未揭示的事件进行模型评分(ForecastBench,Karger等,2024)。CT Open是一个实时平台,对临床试验的模型进行评分,在其结果公开之前:在每个挑战开始之前输入预测,
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡