返回

文章详情

代码模式在我们的系统中实现了99.2%的成本降低

Hacker News2026年7月23日 10:17

相同的分诊。一个路径从未让原始数据到达模型。Anthropic在11月发布了一篇关于MCP代码执行的文章:给代理一个沙盒和一个生成的API,而不是原始工具调用,一个150,000个令牌的任务只需2,000个 — 这减少了98.7%,因为原始数据不必通过模型的上下文。Cloudflare于9月推出了同样的理念,称其为“代码模式”,并随后给出了数字:2,500多个API端点,从1.17M tokens降到大约1,000。我们的第一反应是“我们已经构建了这个。”每个claude/codex/opencode会话在群中都今日推出了一个评分标准 — src/prompts/session-templates.ts中的system.agent.context_mode — 它告诉代理:10个以上的项目或大规模展开意味着寻求一个脚本,而不是N个单独的工具调用。我们并没有为这篇文章添加这一点。这只是团队已经在做的事情,而与脚本工作流背后的同一样机械。我们未曾做的是用Anthropic自己的标准来测量它,使用我们自己的生产数据。所以我们这样做了 — 利用两个我们的代理编写并在全球发布的脚本:workflow-triage。这个脚本的作用是workflow-triage扫描团队运行的每一个自动化 — 所有工作流和所有cron计划 — 并标记哪些已死,失败或正常。在底层,这意味着26个独立的调用:一个workflow_list,一个schedule_list,以及每个工作流一个workflow_listRuns(共24个)。通常,一个代理“手动”执行此操作会进行26个单独的工具调用,每一个原始JSON负载在谈话的其余部分中都会保留在其上下文中。相反,脚本自行在其沙盒的子进程中执行这26个调用,而只有最后提炼出的结果 — 一个摘要对象 — 才会抵达代理。我们所测量的,实时我们没有估算这一点。我们分别运行了脚本和基础调用,针对真实的生产目录(24个工作流,60个计划),并直接测量了双方。脚本(workflow-triage) 原始顺序调用(测量 + 外推) 调用数量 1 26 达到代理上下文 25,811个字符(一个JSON结果) — 精确测量 ~3,259,649个字符 — 见下面的方法 Approx. tokens (~4 chars/token, no tokenizer available) ~6,450 tokens ~815,000 tokens 时钟 13.12秒(durationMs: 13120) — 精确测量 ~2–6.5分钟(估计:26个顺序轮次,未直接运行) 成本(Claude Sonnet 5,$3/1M输入令牌) ~$0.02 ~$2.44(底线 — 见下文) 降低 — ~126x更少的字符达到上下文,~99.2% 诚实关于测量与估算的区别 原始路径的时钟和成本是唯一的估算数字,在这里我们想坦诚每个数字是如何构建的,因为这篇文章的整个意义是“展示你的工作”,而不是“相信我们的感觉”:脚本自己的数字是100%测量的。durationMs: 13120和25,811个字符的结果直接来自一次实时workflow-triage运行,没有四舍五入的把戏。原始路径字符计数是测量后外推的,而不是凭空捏造。我们直接在脚本之外调用脚本调用的确切相同的基础SDK方法(workflow_list,schedule_list,workflow_listRuns),以查看一个原始顺序工具调用的代理实际上会收到什么:workflow_list({}) → 16,304个字符(测量);schedule_list({}) → 72,105个字符(测量);workflow_listRuns直接对24个工作流中的4个进行采样 — 6轮 → 98,706个字符,26轮 → 293,036个字符,53轮 → 157,720个字符,227轮 → 525,968个字符。这是312个采样运行中的1,075,430个字符 — 每次运行的测量平均值为3,447个字符。我们将这个测量的平均值应用于脚本自己记录的所有24个工作流的实际总运行次数(920个运行),从而得出了~3.17M字符的完整原始等效扫描估算,然后添加了两个列表调用。 为什么我们不直接运行所有26个原始调用:这样做意味着要将~3.2百万个原始JSON引入为撰写此贴所用的对话,以证明一篇关于不这样做的文章。我们改为对最小和最大工作流进行采样,并从团队自己记录的运行次数进行外推 — 这比听起来更真实地展示了问题,因为这正是评分标准要求代理在开始逐个调用工具之前做出的判断。 值得标记的一个脚注:限制:25我们传递给workflow_listRuns实际上并不限制结果 — 它返回了我们最繁忙工作流的所有227个运行,而不是25。 这是基础API中的一个实际缺口,值得提交工单,但它并不会改变这篇文章的计算;如果有的话,它使原始顺序调用数更像是个底线,而不是个上限。 $2.44的原始路径成本是个底线,而不是真正的总数。它仅在一个轮次中定价令牌,仿佛它们进入了上下文。在实际的代理循环中,26个原始工具的每个结果都保持在上下文中,并在每个随后的轮次中重新发送作为输入 — 这是正是实现...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡