终端基准科学:评估AI代理在科学研究工作流程中的表现
终端基准科学评估AI代理在研究人员自身工作中的工作流程。科学家,而非模型开发者或数据供应商,为AI的科学能力设立标准。终端基准科学是由斯坦福大学的研究人员主导的基准,由终端基准团队与来自世界各地不同科学学科和研究机构的领域专家合作构建。它通过一组多样化的、专家策划的工作流程来衡量AI代理的能力,这些流程源自科学研究。终端基准科学是一个持续的基准,随着前沿AI的发展而不断演变,在科学需求与AI开发之间建立反馈循环。我们的首次发布包括来自生命科学、物理科学、地球科学、数学和工程科学的70个任务。评估出的最强模型,Claude Opus 5,在终端基准科学0.1上达到了30%的解决率。终端基准科学0.1排行榜 0% 25% 50% 75% 100% Claude Opus 5 Claude Code 30.0% GPT-5.6 SolCodex 22.4% Claude Fable 5 Claude Code 21.4% Claude Opus 4.8 Claude Code 10.5% GPT-5.6 TerraCodex 8.6% GLM 5.3 Claude Code 8.1% Kimi K3 Claude Code 7.1% Grok 4.6 Grok Build 7.1% GPT-5.6 LunaCodex 3.3% 终端基准科学0.1上70个科学工作流程任务的解决率 虽然终端基准已经在软件工程的AI代理中推动了进步,但终端基准科学对科学的追求同样充满雄心。我们的目标是推动具有科学能力的代理的发展,使其成为有用的研究助手。 这些代理应该执行技术要求高且耗时的工作流程,让科学家能够将更多时间集中在科学中人类判断最为重要的部分:定义研究问题、形成假设、解读和验证结果以及交流发现。在这个角色中,AI代理可以扩展研究人员的成就,并帮助加速科学发现。实现这一目标需要反映真实科学实践的基准,提供可验证的能力证据,并与AI前沿同步演变。我们需要基于真实科学工作流程的基准。科学能力应基于真实研究实践进行评估,而非教科书问题或标准化练习,由实际的科学家贡献。终端基准科学为各个领域的科学家提供了一个直接的声音和一个共享平台,以设定AI在他们关注的问题上的进展标准。科学的利害关系太高,其基准必须反映科学社区的优先事项,而不是外部利益。我们需要可验证的科学能力证据。没有可靠的评估,我们无法判断代理能力是否在提高,也无法知道它们的局限性在哪里。终端基准科学在现实环境中评估代理,并使用可重复的任务特定测试对具体成果进行评分,例如分析、模拟、证明、代码和数据产品。我们需要一个与前沿保持同步的基准。科学基准往往被视为发表论文的材料,而不是推动进步的机制。它们一经发布便被抛弃,因为模型不断进步而已知的局限性依然存在。终端基准科学是一个与AI前沿同步发展的持续基准。通过定期发布,科学家可以贡献新的工作流程、改进现有任务,并在科学需求与AI发展之间创建反馈循环。终端基准科学反馈循环 科学社区 前沿AI 代理和模型 贡献工作流程 评估和改进 加速发现 终端基准科学反馈循环 终端基准科学0.1包括生命、物理、地球、数学和工程科学的70个任务。任务涵盖科学数据分析、统计推断、模拟、优化、定理证明、图像重构、信号处理、反问题、传感器校准、模型拟合、分类以及科学机器学习。终端基准科学0.1任务覆盖 生命科学 19 生物学 8 医学与健康 6 神经科学 4 生态与进化 1 物理科学 17 天文学与宇宙学 6 物理学 5 材料科学 4 化学 2 地球科学 8 地球科学 5 大气与气候 1 海洋与海洋 1 环境与可持续性 1 数学科学 17 应用数学与科学计算 6 运筹学与优化 5 形式数学与定理证明 3 统计学 3 工程科学 9 机械与航空航天工程 5 电气与计算机工程 2 化学与工艺工程 1 土木与结构工程 1 70个由专家策划的任务涵盖五个科学领域 这些任务是通过GitHub上的开放过程由研究人员贡献的,并在Discord的#tb-science频道进行讨论和反馈。贡献最初作为提议,其中评审人员讨论每个想法,留下反馈,并批准那些看起来适合的提议:值得科学研究的工作流程。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡