当人工智能基准测试达到饱和时:基准饱和的系统研究
作者:Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman 摘要:人工智能基准测试是衡量模型进展和指导部署决策的重要机制。然而,基准测试很快会“饱和”,使得区分模型变得困难,从而降低其长期价值。在本研究中,我们定义了基准饱和,并使用与饱和相关的14个属性分析了60个语言模型基准。我们发现近一半的基准测试表现出饱和现象,饱和率随着时间的推移而增加。此外,我们发现对饱和的抵抗力受专家策划的影响,而不是受公共测试数据的影响。我们的结果表明,设计选择可以延长基准的使用寿命,并为更持久的评估方法提供信息。 评论:被2026年ICML接受 主题:人工智能(cs.AI) 引用为:arXiv:2602.16763 [cs.AI](或arXiv:2602.16763v3 [cs.AI]用于此版本) https://doi.org/10.48550/arXiv.2602.16763 arXiv发布的DOI通过DataCite 提交历史 来自:Mubashara Akhtar [查看电子邮件] [v1] 2026年2月18日 星期三 16:51:37 UTC (222 KB) [v2] 2026年5月30日 星期六 16:41:50 UTC (640 KB) [v3] 2026年6月29日 星期一 17:01:58 UTC (636 KB)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡