返回

文章详情

当智能成本下降100倍时会发生什么

Hacker News2026年8月21日 13:24

大型语言模型的进展通常以最佳模型现在能够做到的事情来报告,这是以前任何模型无法做到的。这个方向产生了新闻头条,确实令人叹为观止。每一次在高端的进步让模型能够处理之前无法达到的任务,无论是修复跨整个代码库的错误,还是最近在解决以前无人能解的数学问题上取得进展。还有一个进展方向受到的关注较少,那就是用多便宜的价格来购买特定的能力水平。大量有用的工作并不需要最聪明的模型,而是需要一个足够好的模型,经过数千次的应用。阅读一个主题上的每一篇科学论文,检查档案中每个合同中的特定条款,或总结一个大型讨论论坛中的每一个主题都是这类任务。对于这些任务,问题不是是否存在一个能够完成工作的模型,而是它是否能够在预算内完成一万次工作。上限解锁了新的任务类型;下限解锁了数量。当你为某个应用选择模型时,你是在权衡它的能力和每次调用的成本。对于代理编码,我几乎完全专注于能力,普遍感觉提高的工作质量是值得花钱的,即使存在便宜得多但足够可靠的模型。我最近的关注点转向了下限的成本。我们正在测量在DANDI档案中共享的数据集在后续出版物中的重用频率,这意味着要用模型阅读大约一万篇候选论文,并询问每一篇是否确实重用了数据。按照今天的价格,使用在春季时处于前沿的模型对整个语料库进行完整的回顾成本略高于一百美元。按照今年三月的价格,使用同一水平的能力的同样回顾成本将是几千美元,而一年前该能力以任何价格都无法获得。下限的变化使分析从我们能够在样本上进行的事情变成了一个可行的项目。我对整个成本谱系的进展感到惊讶,特别是廉价模型变得多么智能。人工分析已经在过去几年中对数百个模型的智能和价格进行了基准测试,足够的数据可以重建这种权衡。特别是,这张图显示了智能指数与每项任务成本的关系,为不同水平的模型能力提供了现实的成本估计。顶线是他们所定义的“帕累托线”,在给定价格点下的最强模型。这条线描述了大型语言模型的真实前沿。我从artificialanalysis.ai提取了数据,查看了随着新模型的发布帕累托前沿是如何移动的。我认为花一点时间回顾这一进展并对未来几个月做出一些预测是很有价值的。简而言之:二月份每个任务花费1.22美元的智能水平今天的成本为0.022美元,在不到六个月的时间内下降了56倍,下降的速度在加快。按目前的测量速度,给定能力水平下降100倍大约需要一年,而值得问的问题不是这是否会发生,而是它会改变什么。人工分析智能指数 在本帖中能力轴是人工分析智能指数,因此 clarifying 这个数字是什么是很重要的。目前版本 v4.1.1,是基于分为四个类别的九个评估的加权平均:代理任务34%,编码24%,科学推理24%,一般能力18%。加权反映了该领域的关注点:三分之一的分数来自于模型完成多步代理工作的能力,而不是回答考试问题。组成评估、它们的权重和评分细节在人工分析的智能基准测试方法中都有记录。最终得到的是一个表示模型能力的单一数字,类似于大型语言模型的智商。它并不完美,两个具有相同得分的模型可能具有不同的优势,但我发现这个分数可以合理地指示模型的能力。作为参考,Anthropic的“Claude 4.5 Sonnet(推理)”对我和许多人来说是第一次觉得一个模型有能力在代理环境中编写代码。当时我在使用Cline,而这个模型在自动完成和复制/粘贴工作流程上提供了显著的生产力提升。该模型的智能得分为37.4(基于今天的智能评分系统)。目前顶级模型是Claude Opus 5的最大努力,得分为63.1。为了更直观地感受不同指数水平的意义,我借用了Simon Willison的鹈鹕基准:用"生成SVG的一个

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡