提示Claude Opus 5.5
与Claude Opus 5的行为差异以及解决这些差异的提示和利用模式:努力校准、API集成和聊天中的思维行为、进度更新、无人看管和多代理任务、安全拒绝、前端设计、复杂视觉输入、多应用工作流以及用户消息中粘贴的文本。本指南涵盖了特定于Claude Opus 5.5的提示模式。有关模型的能力和API更改,请参见《Claude Opus 5.5中的新功能》。有关适用于所有当前Claude模型的技术,请参见《提示最佳实践》。Claude Opus 5.5的输出令牌生成速度比Claude Opus 5快30%以上,并且倾向于用更少的令牌完成相同的任务。现有的Claude Opus 5提示在没有更改的情况下应该表现良好,且《提示Claude Opus 5》中的模式仍然是一个合理的起点。从匹配您观察到的开始的部分开始:不确定运行哪个努力级别,或运行的轮次比Claude Opus 5更长且成本更高:校准努力您的Claude Opus 5集成在思维禁用的情况下运行:为思维禁用编写的提示一个无人看管的代理在报告进度后中途停止了长任务:无人看管的代理运行请求返回stop_reason: "拒绝": 安全拒绝长代理轮次看起来沉默,或者您希望在可预测的点获得更新:面向用户的进度更新一个跨多个连接应用工作的代理错过了任务未指向的信息:在多应用工作流中探索上下文您管理一队代理,希望它更快完成:多代理利用的时间信号聊天应用中的回复开始缓慢,因为模型首先长时间思考:聊天系统提示中的思维指令模型遵循用户粘贴文本中到达的指令:标记用户消息中的粘贴文本有关密集图表、图示或屏幕截图的答案缺少细节:复杂视觉输入的工具前端输出看起来通用:前端设计默认与提示相关的能力对提示最重要的能力是: 有效编码和代码审查:模型在真实代码库中的多步骤工作上最强,例如在大型代码库中进行更改直到其测试通过。在Anthropic的测试中,在其默认中等努力下,该模型在此类任务中与Claude Opus 5在高努力下的表现相媲美或更好,步骤更少,令牌更少。它在长时间自主工作方面也比Claude Opus 5更好,例如多小时的审核和大型代码库的迁移,通过平行子代理和极少的监督端到端进行。早期测试者还报告了更强的代码审查,发现的错误比Claude Opus 5多,误报更少,并用简单的语言解释其更改。 知识工作:该模型不太可能陈述错误的数字或引用错误的来源。它在财务建模任务方面更好,例如为交易构建财务模型和一页摘要,或找到并修复估值工作表中的错误,并且它捕捉到在大型输入中容易错过的细节,例如一条长期计划线程中的日期落在错误的星期几,或幻灯片中的图表与基础数字不符。它生成的电子表格、幻灯片和文档在共享之前需要更少的编辑。 交流:它对代理工作的报告,无论是工作中的更新还是完成时的总结,清晰地说明了它做了什么、发现了什么以及需要您的什么。请参见《面向用户的进度更新》。图表、图示、屏幕截图和计算机使用:该模型比Claude Opus 5更准确地读取视觉材料而不需要额外的工具:在Anthropic的测试中,即使在其最低努力设置下,它从密集图表中读取值的准确性也超过了Claude Opus 5在其最高设置下的准确性,并使用了极少的一部分输出令牌。在某些情况下,模型也更好,尤其是在意义依赖于位置而不是文本的情况下:例如一个流程图中箭头所连接的框、两个版本图示之间的变化,或日历截图中会议的确切开始和结束时间。在计算机使用方面,模型的可靠性也更高,它能够在多个步骤中从截图中操作应用程序:在其默认努力下,它达到了Claude Opus 5在更高努力设置下才能达到的成功率。请参见《复杂视觉输入的工具》。校准努力 努力是控制Claude Opus 5.5思考程度的主要方式,因思维始终处于开启状态,因此在权衡智能、延迟和成本时,首先要调整的设置。以中等(Claude Opus 5.5的默认设置)开始(Claude Opus 5的默认设置为高),明确设置并针对您自己的评估测试多个级别,而不是延续您在Claude Opus 5上使用的设置。努力级别名称在不同模型之间并不对应于相同的思维程度:在Anthropic的测试中,Claude Opus 5.5在中等设置下的表现相匹配或超过了Claude Opus 5在高设置下的编码和知识工作。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡