Orca-Bench:语言模型智能体的值班准备程度如何?
查看 PDF HTML(实验性)摘要:大型语言模型能够编写、修补和搜索代码,但值班根本原因分析(RCA)则需要不同的能力:对嘈杂的指标、日志、追踪和源代码进行推理,这通常是从模糊的用户报告开始的,往往在事件发生几个小时后进行。我们推出了ORCA-bench,这是一个基准,旨在将通用编程智能体置于生产级值班环境中。ORCA-bench配备了一个实时的OpenTelemetry仪表微服务系统——通过真实的遥测接口(Prometheus、Jaeger和通过Grafana的OpenSearch)暴露六天的指标、日志和追踪,以及完整的源代码访问——以及1079个RCA任务,这些任务系统性地变化了报告的具体性、检测时间和共发生的故障场景。真实的症状由专家SRE进行整理和批准,我们的LLM作为评审被人类重新评分(Cohen's $\kappa_w=0.90$)。在五个前沿智能体中,最佳RCA准确率在中等难度任务(现实输入设置)上为25.3%,在困难任务上为10.0%——即便是使用Claude Fable 5,这一差距仍然存在。最弱的模型在40%的事件报告中幻想出一个不可信的根本原因,而去除源代码访问会降低所有指标。至关重要的是,这些是在一个经过整理的50 GB / 六天的测试平台上的表现,其任务在一个代码和仪表公开的系统中被独立调查。由于真实生产系统的规模大几个数量级,更为动态和特异化,我们报告的差距是一个下限,表明在前沿编程智能体能够安全地被信任于生产可靠性之前所需的工程投资。我们在此 https URL 发布公共集。主题:计算与语言(cs.CL);人工智能(cs.AI);软件工程(cs.SE)引用为:arXiv:2607.28545 [cs.CL](或arXiv:2607.28545v1 [cs.CL]为此版本) https://doi.org/10.48550/arXiv.2607.28545 arXiv发布的DOI通过DataCite(待注册) 提交历史 从:Albert Gong [查看电子邮件] [v1] 2026年7月30日 星期四 17:14:07 UTC(220 KB)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡