私人克劳德聊天在谷歌和必应搜索结果中曝光
发生在你和AI聊天机器人之间的事情并不总是仅仅留在你和聊天机器人之间。问问谷歌就知道了。就在周末,人们惊讶地发现一些Anthropic Claude聊天可以通过网络搜索轻松找到。这个问题似乎第一次是由一名Reddit用户提出的,曝光了聊天内容,包括人们询问他们应该加入哪个政党、堪萨斯州的律师是否需要在认为自己犯了伦理违规时自我报告,以及色情角色扮演。Claude允许用户通过创建特定聊天机器人的公共URL与其他人共享聊天的“快照”。这些URL被主要搜索引擎索引的原因归结于网站、搜索引擎的基本功能,以及当生成性AI介入时两者之间的冲突。基本上,Anthropic指示网络爬虫,例如谷歌和必应等搜索引擎使用的爬虫,不要索引用户决定与其他人共享的聊天。该公司通过一种称为robots.txt的文件来实现这一点,该文件长期以来被认为是告诉网络抓取器网站哪些部分可以访问的标准方式。根据Wayback Machine的快照,Anthropic的robots.txt自2025年9月以来就已将“共享”聊天限制在网络抓取器之外。但阻止页面被包括在搜索引擎结果中比你想象的要难。到撰写本文时,如果你搜索“site: claude.ai/share”,必应仍然显示“约612个结果”,该文档称开发者可以使用robots.txt阻止搜索引擎的网络爬虫——但网络开发者也应该在每个页面上包含“noindex”标签。Reddit帖子中标记的一些出现在搜索结果中的聊天,在WIRED查看时已被删除,而在谷歌中搜索时“共享”查询不再显示结果,尽管该查询在必应中仍然有效。在开发者指南中,谷歌表示,如果该页面从互联网其他地方链接,且页面所有者未在页面上添加特殊的“noindex” html标签或在页面的响应头中添加“x-robots-tag”,则会忽略robots.txt指令。WIRED审查了一些曝光的Claude聊天页面,发现它们没有包含谷歌和必应在决定是否索引页面时考虑的“noindex”标签。拥有必应的微软未在发稿前提供评论。Anthropic没有回应多项评论请求。谷歌发言人内德·阿德里安斯告诉WIRED,索引共享的Claude聊天是Anthropic的责任。“谷歌或任何其他搜索引擎都无法控制网页在网络上被公开的情况,这些页面已在多个搜索引擎上被索引,”阿德里安斯说。“我们给网站所有者提供明确的控制,决定页面是否可以被爬虫抓取或索引,我们始终尊重这些指令。”Anthropic没有回应关于为何未在共享聊天页面中包含“noindex”标签的问题。去年九月,Anthropic因同样的问题受到批评,并告诉《福布斯》,它使用robots.txt让爬虫知道不应访问共享聊天。但正如《福布斯》的报道指出的那样,这并不能保证能阻止搜索引擎对特定网页的索引。即使robots.txt并不总是能有效阻止页面在搜索引擎中被索引,AI实验室仍然在其他方面利用它。许多实验室向创作者承诺,他们的网站不会被用作AI训练材料,只要开发者确保在robots.txt文件中“禁止”某些爬虫,而实验室自身也遵循这一建议。Anthropic、Meta和OpenAI都在其聊天机器人的robots.txt文件中包括了指示,禁止其竞争对手的网络爬虫访问托管聊天机器人的网站的任何部分。OpenAI和Meta未对关于该做法的评论请求作出回应。谷歌没有回答WIRED关于其竞争对手阻止其AI训练爬虫Google-Extended访问其聊天机器人网站的问题。虽然共享聊天不再出现在谷歌搜索结果中,但WIRED审查的页面仍然没有“noindex”标签,这意味着它们可能再次出现在搜索引擎中。Claude用户可以前往设置 > 隐私 > 共享聊天来管理访问权限——并保持他们的私密对话的私密性。额外报道由安德鲁·库茨提供。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡