我燃烧了我所有的代币,研究如何节省代币
在Quesma,我们正在研究AI代理的经济学:真正的代理编码成本是什么,以及你可以为此做些什么。为了这项研究,我正在运行自己的深度研究设置,一个建立了我可以真正信任的知识基础的代理管道。这一设置的第一个版本在30分钟内就耗尽了我Claude Max 5x计划的所有限制。这篇文章讲述了我是如何修复成本和信任的,使用的仅仅是我已经付费的订阅,以及你如何构建相同的东西。我的目标是理解所谓的代币经济学的整体状态。我想知道现存的监控系统是什么,团队是如何管理他们的AI支出,以及哪些优化工具和实践在文献和现实世界中实际上有效。我开始了常规方法,使用/deep-research。我给了它一个大的开放问题,让它运行。大约经过30分钟的研究后,我达到了一个限制,必须等几个小时才能重置。而且我没有得到任何结果。这次运行启动了111个代理,并排队123个待验证的请求,但在达到限制之前只有25个得到了验证,最后的综合分析从未运行。所以,这对我个人产生了影响。这有点搞笑:从第一天起,我就在不断优化代币的同时又在发现如何优化代币。通过实践学习。利用我已经付费的每一个订阅。如果Claude Fable 5在30分钟后就停用了,而/deep-research消耗了这么多代币却没有给我任何结果,我能做些什么来使研究更有效呢?我开始考虑我已经拥有并支付的工具。Claude、Codex和Antigravity:3个订阅,理论上可以在没有额外支付的情况下获得3倍的代币。如果我把所有这些工具结合使用,利用共享内存呢?因为我已经在使用claude-mem插件,所以我扩展了它以支持Codex和Antigravity在本地使用,以便这3个工具都可以在会话中共享内存。一个工具学到的东西,其他工具都可以使用。作为子代理的更便宜的模型我的默认设置是Claude Code,因此我将其用作主要的工具。在手动进行研究时,我发现了一种模型编排模式,这正是我当时所需要的。我们并不需要Fable来处理所有事情:Claude Opus 4.8、Claude Sonnet 5、GPT-5.5和Gemini 3.1 Pro在许多任务中已经是优秀模型。Claude Code作为主工具:原生的Claude代理、Codex和Antigravity作为无头子代理,所有共享claude-mem。因此,我查看了一些基准测试和成本分析,主要是Terminal-Bench用于终端和代理工作,SWE-bench Pro用于端到端软件工程,Artificial Analysis用于性能和价格的整体视角。我没有把它们当作最终真理;基准测试测量的是它们自己的东西,数字每个月都在变。我只需要一个宽松的起点来了解谁在什么方面表现良好,并且从一开始就使用几种不同的模型是实验的一部分;无论如何,我预计在真实运行后会调整拆分:角色模型为什么选择这个查找Claude Sonnet 5 在代理基准测试中表现强劲,且足够便宜以大批量运行验证Claude Opus 4.8最准确的Claude工作者;检查需要比搜索更高的准确度审 judge & plan Claude Fable 5最昂贵的模型,因此它只进行计划、分解和解决争议小事Claude Haiku 4.5在提取和格式化方面便宜且快速,但处理多步骤工作时太弱工具Codex (GPT-5.5)在终端基准测试中表现非常强;克隆、安装、运行并检查工具第二意见Antigravity (Gemini 3.1 Pro)不同模型系列,因此它没有共享相同的盲点这个拆分不是我第一次的版本;在实时运行显示出弱点时,我调整了几次,而后备规则来自于这些失败。最重要的是,我准备好让Codex和Antigravity作为Claude子代理,被Fable编排,并利用两个模型的无头特性。它有什么好的?因为代币来自Codex和Antigravity的订阅,所以我没有额外支付,但我立刻有了更多的智能可以使用。整件事的诀窍是一个小Bash脚本,我的Claude代理可以像其他命令一样调用:# run-cli:作为无头子代理调用另一个供应商的CLI # 使用方法:run-cli <codex|antigravity> "<prompt>" VENDOR = "$1" ; PROMPT = "$2" case "$VENDOR" in codex) OUT="$(codex exec --sandbox read-only "$PROMPT")" ;; antigravity) OUT="$(agy --model "Gemini 3.1 Pro (High)" -p "$PROMPT")" ;; esac echo "$OUT" echo "$OUT" | claude-mem-save -s "$VENDOR" # 保存到共享内存(我本地扩展的claude-mem)包装器还监视输出中的“使用限制”和“余额不足”消息,并返回特殊的退出代码,这正是自动回退到Claude模型的工作原理:调度程序看到信号,并用Claude代理完成工作。另一个真正重要的事情是固定每个角色的模型,因为子代理默认会继承其父代理的模型,而这正是如何...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡