展示HN:FrontierHarness Eval – 9个harness,相同模型,每次通过的成本变化17倍
Hacker News2026年9月2日 16:14
通过率 中位数 每个成功任务的中位成本 每个任务的中位成本 每个成功任务的中位缓存命中率 每个成功任务的中位时间 超越数字 01 OpenCode:排除失败。它仅覆盖15次通过。计算失败尝试,数字变为每个任务3.24美元。02 缓存命中率并不是成本。一次300轮的缓存失败仍然可能消耗超过一次短期的缓存未命中。03 质量和成本可能会有所偏离。Claude Code成功完成19个任务,但每个任务的成本达到18.34美元。在Runta上运行你的harness。如果你想在Runta上测试自己的harness,我们会给你100美元的积分以便开始。获得100美元积分 开始免费试用 已测试的harness Codex v0.148.0 DeepSeek Harness v0.1.0-rc.8 Claude Code v2.1.237 Pi v0.84.2 Oh My Pi v17.4.0 Kimi Code v0.37.2 Exo Harness v0.1.0 OpenCode v1.18.19 Hermes v0.20.4 FrontierHarness v1.0聚焦于软件工程环境和基于终端的任务。它可能不能推广到其他知识工作领域。评估是在Runta代理运行时进行的。所有harness和任务环境都在一次黄金检查点中准备好。每次运行都是一次全新恢复,具有相同的vCPU、内存、磁盘大小、磁盘内容和内存状态。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡