Databricks 降低了 70% 的 AI 编码支出
人工智能编码工具带来了巨大的价值:在 Databricks,自主编码显著改善了我们跟踪的每一个速度指标,并且在某些团队中,产出提高了一个数量级。但几乎每个大规模部署 AI 工具的公司都遇到了同样的瓶颈:成本呈指数增长。这一趋势是不可持续的——如果不加以控制,最终将超过收入。支出激增使企业陷入了一个矛盾的境地:一方面,渴望最大限度地推动 AI 转型,将强大的工具交到员工手中;另一方面,又不得不面对一个威胁到 AI 提供的效率提升的总成本结构。幸运的是,一些最早的大规模采用者汇聚了一系列解决这一难题的方法,实现了一种“双重任务”: (a) 以最小的摩擦提供广泛的 AI 工具访问,(b) 保持每个用户的总成本在大致固定的范围内。本文概述了基于我们在 Databricks 的经验及与多家数字原生公司的对话(包括 Stripe、Coinbase、Uber 和 Ramp)所验证的成本管理技术。下表总结了当前的技术和相关的节省;这些数字是方向性的,基于对开发团队的非正式调查:一些技术可以与许多公司已经使用的软件轻松实施。其他一些则需要新的基础设施,特别是那些修改最终用户客户端或改变模型之间流量的技术。在 Databricks,我们已开源或免费提供了我们的关键基础设施组件:一个终端用户元工具 (Omnigent) 和我们的 AI 网关 (Unity AI Gateway)。为了完整性,本文还涵盖了我们与其他公司交谈时使用的软件。编码模型的“效率边界” 将编码支出转向更高效模型的最大成本杠杆在于推出新模型。这个观点需要一些讨论,因为“更便宜的模型”的简单解释实际上隐藏了模型成本与质量之间的复杂关系。俗称前沿模型的术语意味着“最高智能模型”,而前沿实验室主要集中在推进顶尖智能方面。前沿模型现在可以解决数学或网络安全中的新问题。但当 AI 在大规模上部署时,另一种类型的前沿更为重要:效率前沿。效率前沿由一组在给定智能水平上具有最佳价格点的模型定义。大多数日常编码并不需要数学证明或新颖的安全见解,因此在整体上,符合典型软件工程工作质量标准的模型成本才是关键。这一“效率前沿”正在远比智能前沿更快地发展,几乎每周会推出表现出比之前模型更优价格智力比的新模型。成本杠杆 #1:转向开源和低成本模型 快速采用更新、更高效的模型能带来任何技术中最大的成本收益。但为了捕捉这些收益,公司首先需要了解哪些模型实际上超越了其现有模型。这可能很困难,因为公共基准对于编码任务的真实表现指示效果不佳。为了评估新模型,许多公司构建了自动化评估,他们认为这些评估更能代表他们内部的开发组合。Databricks 最近发布了这样一个基准的示例,在该示例中,我们观察到 GLM 模型具有高度竞争的性价比。该基准促使我们在内部向开发人员推出 GLM。通常,新模型不会推动效率前沿,而评估经常产生负面结果:Stripe 发现 Opus 4.7 并未显著改善质量,相比 Opus 4.6 反而增加了成本。因此,他们决定不在内部提供 Opus 4.7。Databricks 在比较 Opus 5.0 和 4.8 时也观察到了类似的成本回退。工具和模型灵活性 由于最大的收益来自于切换新模型,因此采用允许模型灵活性的终端用户工具已成为降低成本的关键组成部分。与特定模型相关,最常用的工具称为工具架(harness)。专有前沿模型越来越多地设计为与特定工具架良好配合,这意味着某些工具架与某些模型“配合更好”。如果一家公司想要保持模型独立性,大致有两种方法:要求用户更换工具架。一种方法是为开发人员提供一系列工具架(Claude Code、Codex 或 Cursor),然后在公司想要将支出迁移到低成本模型时要求他们在工具架之间切换。这允许用户在可能的情况下使用其首选工具架,但这种方法的缺点是单个开发者的切换成本可能很高。如果切换成本变得过高,工具架本身
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡