返回

文章详情

Warp在Claude上构建自我改进的智能体

Hacker News2026年8月29日 19:09

在我们的系列文章中,突出创业公司如何利用人工智能转型其行业。在本文中,我们分享Warp如何将无状态的用户反馈转化为智能体的自我改进循环。快速简介名称Warp成立于2020年创始人Zach Lloyd(首席执行官)技术栈Rust、Golang、GitHub Actions、内部智能体编排平台(Oz)、Claude平台融资7300万美元。每月在Warp上构建的开发者数量达到80万。500强企业中有56%使用Warp。到目前为止,Warp内部运行的Claude代码会话达到1000万,每周超过40万。Warp代理的对话总数达到4000万。智能体需要可靠和有效地处理重复任务。一个第一次提示能使任务正确率达到80%的情况,会给用户带来噪声和烦恼的体验。Warp以艰难的方式了解到这一点,并用此来指导其产品策略,为全球近100万开发者创造了改进的体验。Warp是一个基于Claude平台的人工智能终端和智能开发环境。团队在其内部代码审查智能体时遇到了这种“噪声体验”问题。工程师们抱怨他们的智能体提供了无用的评论,并产生了低质量的输出。团队最初尝试了一些应急解决方案,比如根据观察到的代码审查失败手动重写提示。这使得输出更易于使用,但并未扩展。改善AGENTS.md等上下文件也有所帮助,但远未完全解决。最终,他们意识到,反馈对于任何目的的智能体而言,通常在会话结束时会消失,从而移除了智能体循环中关键的上下文。他们的解决方案是:基于智能体技能的框架,创建自我改进的智能体,使反馈随着时间的推移不断积累,以不断完善和增强智能体的输出。继续阅读,了解他们如何在Claude平台上构建这种基于技能的自我改进循环。基于技能的智能体自我改进循环中央技术是使用技能的自我改进循环,这些技能是知识的文件编码,将指令与原始提示分离。Warp发展出一种自我改进的智能体架构,由两个技能组成,中间夹杂人类的反馈。内/基础技能持有功能领域知识和指令。例如,当PR被打开时,Warp的代码智能体使用该基础技能和上下文来执行审查。对智能体输出的人类反馈是自我改进循环的关键组成部分。对于代码审查,这可能是简单的赞同,但越明确越好。“人类可以确认,‘这是一个好的、有用的评论’,”Warp创始人Zach Lloyd解释道,“但人类也可以提供详细的理由说明为什么某个代码审查不好。像‘你建议重命名这个变量,但我们的代码基准约定是这种类型的全局变量使用这个特定命名上下文’这样的具体内容,让智能体知道下次应该如何做得更好。”外部/改进者技能作为观察智能体运行,按计划进行,而不是按任务进行。它汇总累积的人类反馈,比较智能体的建议与人类的反应,并对基础技能提出小而集中的编辑建议。由于技能是普通文件,智能体在更新它们方面非常高效。这些可审查、可批准和可合并的更新可以通过正常的PR/代码审核工作流程流动;一旦合并,内技能的下一次运行就会继承改进。Warp现在在其整个开源代码库中运行这种模式,拥有单独的规范编写、审查和分流智能体,各自拥有自己的自我改进循环。“基于文件的技能是一种为智能体编码知识的方法,无需将该知识直接放入提示中,而是让智能体可以在执行工作时查阅。”Zach说。“这个框架其实非常简单:有基本的领域特定技能,然后是改进者技能,后者完善该领域特定技能。这种简单性就是这种方法的美丽。”如何为智能体编写自我改进的技能以下是Warp团队编写自我改进技能以实现智能体循环的一些有效建议:编写原则,而不是规则。“构建技能就像是在指导一个聪明的人,而不是在编程一台计算机,”Zach说。“在技能中包括像‘寻找重复代码’这样的指示,比详尽的变量命名规则提供了更好的方向。”解释为什么。提供规则背后的理由,允许智能体推理问题,而不是遵循固定的指令,这又能改善泛化。让反馈变得轻松易给。在人们已经工作的地方捕捉反馈,比如直接在PR或问题上评论。同样,让这一过程自动化,无需额外的提交步骤。“低摩擦是保持信号流动的关键,”Zach指出。“如果你让它太困难,你不会得到反馈,也无法改善技能。”保持技能小巧,并使用进度管理。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡