
克劳德与聊天GPT:这两种AI助手的区别
对于许多人来说,这场人工智能的较量中有一个明显的赢家。RixAiArt/Shutterstock 聊天GPT可能是大多数人首次接触LLM的产品,因为它在2022年推出后迅速吸引了大量用户。它还享有特权地位,因为在2023年3月安索普公司发布克劳德之前没有真正的竞争。从那时起,两家公司不断改进其模型并添加新功能。但由于功能重叠——两个平台都有编码模式和专用工作区模式——这使得很难决定哪个工具最适合你。此外,在日常使用中,两者之间几乎没什么区别:你可以使用它们来编码、回答快速查询、总结文档、组织文件,甚至,如果你感到尤其不敬,可以以赫尔曼·梅尔维尔的风格撰写思想领袖文章。然而,若要超出这些,你就需要开始考虑哪个LLM更适合你的用例。克劳德的准确性是否高于聊天GPT?在LLM中衡量准确性可能很棘手,因为没有明确的答案。你使用的具体模型和你输入的提示在输出质量中扮演着重要角色。在旗舰模型中——克劳德Fable 5(Max)与GPT 5.6 Sol(Max)——根据AA-Omniscience准确性基准,克劳德略微更准确。这两者的分数分别为61%和59%。由于差别微小,你在日常使用中几乎不会注意到。然而,除非你在最大限度地使用代币,否则在大多数任务中你使用的是中层模型。克劳德的中层模型是Sonnet 5,而聊天GPT的是5.6 Terra。在这里,天平倾向于聊天GPT:聊天GPT 5.6 Terra(Max)得分46%,而克劳德Sonnet 5(Max)的得分显著低至38%。在衡量准确性时,另一个重要因素是模型的幻觉倾向。理想情况下,如果LLM不知道某个问题的答案,它应该直接拒绝回答,而不是编造答案,即幻觉。在这一基准中,克劳德在对抗聊天GPT时占据显著优势。较低的分数在这个基准中更好,克劳德Fable 5模型得分55%,而聊天GPT 5.6 Sol的得分为89%。在中层模型中,这一差异更加明显:克劳德Sonnet 5得分37%,而聊天GPT 5.6 Terra得分85%。克劳德能做什么而聊天GPT做不到?Ascannio/Shutterstock 使用克劳德和聊天GPT的人所用的方面是有区别的。根据2026年3月安索普经济指数报告,42%的克劳德对话围绕个人使用展开,45%与工作有关(其余是课程作业)。OpenAI的一份类似报告显示,聊天GPT的70%使用与工作无关。克劳德Cowork自2026年1月推出,可以代表你执行基于知识的任务:我主要用它来组织文件。你还可以创建称为技能的指令包,在对话中使用斜杠(/)进行调用。此外,克劳德Artifacts可以即时呈现代码片段、单页HTML网站、互动的React组件和图表。你也可以在网络上分享和发布Artifacts。聊天GPT也支持技能,但实现方式不同于克劳德。例如,聊天GPT技能只能在Codex和API中由个人用户使用,而不能在常规聊天中使用。克劳德的技能可以在聊天、克劳德Cowork和克劳德代码中使用。聊天GPT的Artifacts等价物Sites是面向企业的内部使用,仅在Codex中可用。此外,聊天GPT的Sites无法提取实时数据,而克劳德的Artifacts可以通过连接的应用和模型上下文协议(MCP)连接器来做到这一点。有些功能在聊天GPT中实现得更好。尤其是语音功能:聊天GPT的声音更自然,你可以打断它,与它交谈,而它不会失去之前所说内容的脉络。对于实时帮助,你可以在高级语音模式下使用实时视频功能,指向你面临的问题。聊天GPT还有一个图像生成功能,可以创建照片般真实的图像,而克劳德只能使用HTML和SVG构建图表、图形和交互式视觉效果。聊天GPT在2026年表现得更糟吗?聊天GPT的新模型在几乎所有AA-Omniscience基准测试中得分都比之前的模型更好,但使用该应用的整体体验似乎在下降。如果你有这种感觉,你并没有错,因为有些领域之前的模型表现得比最新的要好。其中一个领域是幻觉:我之前提到的同一AA-Omniscience幻觉率基准显示,GPT-4o的幻觉率为38%,而GPT-5.6 Sol的则为89%。OpenAI还引入了保障措施,与行业保持一致。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡