返回

文章详情

llms.txt:一个没有主要人工智能平台确认使用的提议标准

Hacker News2026年8月18日 19:24

实现 · 有争议 本文件的大多数写作都有其销售目的。这里是测量所说的内容,接下来是我们仍然推荐的内容,以及为什么这两者不是冲突的。简而言之,llms.txt 是你网站根目录下的一个提议的 Markdown 文件,列出你最重要的页面,以便人工智能系统知道首先阅读哪些内容。它不是一个标准,当前影响 AI 引用的证据很弱。但无论如何还是可以发布一个。它只需二十分钟,这不会有害,而是在未来代理在机器可读的网站表面上路由的便宜选择。只是不要以此为基础构建战略。 01 2026 数据显示的采用率 约为十分之一。SE Ranking 对 300,000 个域名的研究发现,采用率为 10.13%——而在最常被 AI 引用的五十个域名中,只有一个有这个文件。爬虫几乎不会获取它。Limy.ai 对超过 5 亿个 AI 机器人事件的监测分析发现,只有几百个请求直接针对 /llms.txt。 GPTBot、ClaudeBot、PerplexityBot、OAI-SearchBot 和 Google-Extended 更倾向于抓取 HTML。谷歌已经表示不支持。Gary Illyes 确认谷歌不支持 llms.txt,且没有计划;John Mueller 将其与被否定的关键词元标签进行了比较。谷歌的 2026 年生成式 AI 文件列出了它作为不必要的策略。目前没有供应商承诺。到 2026 年,没有主要的人工智能公司公开承诺在生产中阅读或采取行动 llms.txt。现有文件的大部分是垃圾。HTTP Archive 的 2025 年 Web 年鉴发现,约 40% 的发布文件是插件生成的默认值,而不是故意制作的文档。 02 那么为什么要发布一个?三个可以辩护的理由,没有一个是“它会让我被引用。”成本几乎为零,选项是真实的。二十分钟如果在代理路由标准化的情况下为你买来了一个位置,那是一个合理的不对称赌注。撰写它是一个有用的推动因素。制作你四十个最重要页面的一句描述,可以显露重复、孤立的内容和实际上没有任何信息的页面。一些团队从审核中获益比从文件中获益更多。这是一个面向代理的表面,而不是一个 SEO 工件。有趣的用例不是搜索引用——而是一个代理试图弄清楚你的公司提供什么,以及每个事物的权威页面在哪里。 03 如何正确写一个文件 提案规定使用 Markdown:一个带有网站或品牌名称的 H1,一个引用的摘要,可选自由散文,然后是列出链接和每个链接一段描述的 H2 部分。保持其精心策划——十到四十个真正重要的页面,而不是一个网站地图的倾倒。 # 示例 Co > 对该组织的描述段落, > 其服务的对象,以及使其内容具有权威性的原因。可选散文:网站的范围、涵盖和未涵盖的内容、许可或引用偏好。 ## 核心指南 - [什么是 X](https://example.com/what-is-x):一段关于这个页面回答什么的句子。 - [X 如何工作](https://example.com/how-x-works):一段关于这个页面回答什么的句子。 ## 参考 - [词汇表](https://example.com/glossary):网站上使用的 40 个术语的定义。 ## 可选 - [完整文本](https://example.com/llms-full.txt):每个页面的纯文本副本。我们自己的 llms.txt 和 llms-full.txt 是在线的并遵循这个形状。复制它们。 基本原则 作为 text/plain 提供,位于网站根目录,即 /llms.txt。使用绝对 URL。无情地策划——文件相对于网站地图的唯一优势在于编辑判断。包含最后审核日期并保持其更新。过期的文件比没有文件更糟。除非正确处理索引,否则不要将每个页面重复作为 Markdown 镜像。 04 如何检查是否有人读取了它 不要猜测。从访问日志中过滤请求 /llms.txt 和 /llms-full.txt 的已知 AI 用户代理。你也可以在文件中嵌入一个独特的 URL,该 URL 在其他地方不出现——一个只有自动化读取者会跟随的诱饵——并监控命中。Cloudflare 的机器人分析可以按用户代理解析这些信息,而无需接触原始日志。 优先检查 如果在这一季度的时间有限,花费时间在爬取访问、答案结构和原创数据上,而不是在这个文件上。这种排序是整个堆栈的主要论点。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡