针针: 你的搜索引擎无法记住的基准
现有基准无法比较搜索引擎。现有的基准大多是静态的:一组固定的问题被冻结在时间中。静态基准容易导致过拟合。系统可以在测试数据上进行间接的过拟合。Qwen3-Max-Instruct 在 Epoch AI 的 SimpleQA 验证排行榜上名列前茅,而 Epoch 自身又标识其可能受到污染;打乱 MMLU 答案选项降低了每个测试模型的准确性;而搜索代理只是直接从 HuggingFace 获取的基准和真实标签(约占 HLE 问题的 3%)。最后一种失败模式值得关注,因为代理评估使得这一点变得非常容易。网络搜索和获取工具可以访问 HuggingFace 数据集。获取工具甚至可以下载和读取数据集文件,因此在基准上进行测试的模型可以在评估过程中定位到同一基准并读取答案密钥。我们已经看到前沿模型确实这样做了,允许自定义 Python 或 Bash 命令使得这变得更加容易:一次 wget 和一次 grep,“搜索任务”就完成了。代理可以从 HuggingFace 下载答案。即使在测试时没有泄漏,记忆也会破坏测量。有时模型仅仅知道答案。例如,在 BrowseComp 上,问题的设定使得答案很难找到,但容易验证,然而已经记住答案的模型完全跳过了“难以找到”的部分。它知道立即要搜索什么,并直接查询最终答案。代理可以记住这个晦涩的答案,并将轨迹向其弯曲。实时基准不容易出现过拟合:如果问题比模型更新并且不断变化,就没有东西可以记忆,也没有东西可以泄漏。这在其他领域已经成为标准实践:LiveBench 每月更新问题,LiveCodeBench 只对比训练截止日后更新的问题进行评分,SWE-bench-Live 从新的 GitHub 问题中重建任务。搜索也应该设计成这样,但目前没有针对网络搜索的实时基准。NEEDLE:代理网络搜索的实时基准。为了应对这些问题,我们建立了一个实时基准 NEEDLE(新闻,日常,专家,深度尾部和法律评估),旨在测量搜索引擎的性能。该基准建立在公共数据源上,并覆盖反映典型代理搜索意图的查询类型:新闻:打破和发展的故事,即人们现在正在询问的故事,每小时从策划的 RSS 源和 Google Trends 生成。金融:日常公司的 SEC 文件查找,已知答案来自 Wikidata,GLEIF 和 SEC XBRL。学者:专家文献搜索;任务是从简化的标题、全文细节或描述(灵感来源于 Exa 的出版物搜索评估)中找到特定论文。代理Rare:晦涩的长尾实体;来自 DeepResearchGym、LRAT 和 OpenResearcher 代理搜索日志的稀有词查询。法律:找到特定的法院意见或联邦法规的某一部分。这些查询基于新数据构建:RSS 源,Google Trends,金融和科学 API。此外,还有一个稀有单词的查询流,直接从公共代理日志中抽样。每个任务每天或每小时在新查询切片上重新运行。我们使用此基准将 Keenable 与主要搜索引擎进行比较:Google(通过 Serper),Bing(通过 SearchAPI)和 Brave。还有一些 AI 搜索初创公司:Tavily,Parallel,Exa。为了将分数放在上下文中,NEEDLE 还报告了一个最终的上限:一个合成引擎可以保留任何与比较中的引擎找到的最佳结果,按同一评判标准排名。它不是一个真实的引擎,但它展示了在所有引擎之上完美的重排器所能得出的分数。NEEDLE 的不同任务结果。垂直方向在查询复杂性上有所不同。包含论文标题或公司事实的查询大体上得以解决。基于全文细节构建的关键字查询区分了索引文档主体的引擎与仅索引元数据的引擎。在自然语言和半记忆的描述上,词汇引擎几乎完全停止工作。最难的集合是来自真实代理日志的稀有实体查询,即使是最佳引擎也会遗漏该领域集体发现的大部分内容。这也是与真实代理流量最接近的查询类别。查询集越接近代理实际搜索的方式,提供的质量与可实现质量之间的差距就越大。你可以在我们的 GitHub 仓库中阅读其代码以及所有查询收集和判断程序。衡量搜索引擎如何学习和改进。NEEDLE 的一个好特性是,它让我们可以跟踪搜索引擎质量随时间的变化。这表明这比任何单一快照更重要:对于代理搜索,值得关注的问题不是今天谁最好,而是谁改进得最快。搜索引擎应该通过一种使用方式不断改进,这种改进并不是工程上的推动,而是架构的属性。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡