返回

文章详情

Cloudflare为客户推出新的AI流量选项

Hacker News2026年7月25日 22:50

一年前,我们宣布了第一个内容独立日,并为网站所有者提供了重新掌控其内容的手段。维持了30年的爬虫与网站所有者之间的协议——我们抓取你的网站,你获得推荐流量——已经不再成立。人工智能正在剥夺一切,却没有回馈给网站所有者,这对他们构成了生存威胁。因此,我们推出了一键“阻止AI机器人”选项,以及按抓取付费市场。过去一年中,变化颇多。去年七月,围绕“AI机器人”的讨论主要集中在在没有补偿的情况下阻止AI训练,指向那种在未为网站所有者创造价值的情况下,内容被用于模型训练的双赢协议。但人们对于更多细节的期望也开始显现:内容拥有者仍然希望能够保护自己的内容,并且应该因其努力创造、策划和分享的原创内容获得补偿。我们还知道,禁止内容访问并不是适用于所有人的解决方案;网站所有者希望拥有更多选择,而不仅仅是“每次都阻止所有自动化”。如果你经营一个小网站,问题不仅是有人可能会用你的内容训练模型——而是根本没有人能发现你。因此,你不得不做出一个艰难的选择:要么在搜索结果中出现,让AI使用你的内容进行训练,要么冒着失去发现性的风险。如果他们使用相同的机器人进行搜索和训练,这对现有搜索提供商不公平地赋予了优势;而这种不公平的优势使得新参与者在试图缩小竞争差距时显得更加狡诈。如今,AI可以是任何东西。今天,AI可以出现在任何事物中。谷歌搜索从依赖AI排序转变为在结果页面直接回答你的问题的完整答案引擎。谷歌并不是在这个位置上唯一的——这就是“搜索”正在发展的方向。我们可以辩论什么算作“AI”的标准,结果只是发现标准明天就会改变。因此,我们更新的分类方法将不再仅仅将机器人定义为“AI”或“非AI”,而是将询问更深层次的问题:它们在我网站上做什么?它们在存储什么?它们将如何分享我的内容?务实的分类法 为了回答这些问题,我们需要一个更为细致的视角——一个与我们客户关心的AI用例相匹配的务实分类法。因此,我们将讨论扩大到不仅限于AI训练,并集中在三个AI用例上,我们希望所有客户能够管理:搜索:任何收集或索引你的内容的行为,以便稍后可以回答与之相关的问题。关键在于,搜索在主动建立你网站的数据库,以便随后响应查询。网站所有者应该期望因此获得推荐流量或其他公平补偿。代理:在通常情况下以实时方式代表个人做出某些事情的自动化行为。包括聊天抓取机器人(例如,ChatGPT-用户)和浏览器使用代理(例如,驱动Chrome的Gemini或Claude)。关键在于,它访问你的网络应用程序以完成一项工作,通常一边有一个人正在等待。训练:抓取器以获取你的内容进行模型训练或微调。关键在于,你的数据永久地被吸收到AI的基础架构中,以提升其能力。网络上许多流行的爬虫都属于上述分类中的一类;一些则属于多个分类。我们还对超出上述三种分类的许多其他行为进行了分类——包括广告验证、提要抓取和代理交易(关于这方面会有更多内容)。但我们相信,所有网站所有者都应该能够轻松管理这三种以AI为中心的用例的访问权限。我们认为,机器人运营商应当分别管理其爬虫,因为这能为网站所有者创造更大的透明度:使他们能更好地理解某个爬虫访问他们的原因,以及更好地管理他们对该爬虫的访问权限。如果一家公司运行着构建搜索索引、充当代理并收集数据以训练其模型的自动化操作,我们强烈建议该公司将自动化分成三个独立的爬虫。我们希望建立一个可扩展、能够代表自动化流量世界演变的分类系统。跟踪机器人的目的并不是什么新鲜事,但我们新的分类法涉及一些更新,更好地代表今天机器人流量的状态。值得注意的是,我们希望承认那些具有多重目的的机器人应当与所有目的一起被追踪,而不仅仅是其中之一。管理AI流量的新选项 我们希望为Cloudflare网络上的所有网站所有者提供更多管理不同类型AI流量的选项。我们过去宣布的“阻止AI机器人”的托管预设包括了抓取数据用于模型训练的单一目的机器人,如下所示:2025年7月1日管理AI机器人流量的现有设置的截图

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡