// 指南
什么是 llms.txt——你的网站需要它吗?
更新于: 2026-08-19
// 简短答案
llms.txt 是一份提案性标准:放在 /llms.txt 的 markdown 地图,把网站的关键页面整理给 AI 系统看。“提案”是关键词——没有任何主流 AI 厂商承诺读取它,而实测显示,97% 已发布的文件在一个月内收到零次请求。如果你的架构能免费生成它,那就发布;但目前不要对它有任何期待。
llms.txt 是什么
这份提案来自 Answer.AI 的 Jeremy Howard,2024 年 9 月 3 日发布在 llmstxt.org。思路是:HTML 页面对语言模型来说既笨重又杂乱,因此网站应当在 /llms.txt 提供一份经过筛选的 markdown 地图——一个 H1 写站点名称,一段引用块概括“理解文件其余部分所必需的关键信息”,随后是若干链接小节,每条都是 markdown 链接,可选附一行说明。名为 Optional 的小节用于标注在需要更短上下文时代理可以跳过的链接。规范还建议为页面提供干净的 markdown 孪生版本,地址与原页面相同、末尾加上 .md。
llms.txt 不是两样东西。它不控制访问——不授予也不拒绝任何权限,那是 robots.txt 的职责,我们已在 robots.txt 指南里梳理了每个 AI 爬虫的开关。而 llms-full.txt——把整站正文装进单一文件的做法——根本不在规范之内:它是生态圈的约定,2024 年 11 月开始流行,当时 Mintlify 为其托管的每个文档站点自动生成这两个文件。
真的有人读 llms.txt 吗?
这正是大多数指南绕着走的问题——AI 爬虫真的会用 llms.txt 吗?——而实测答案很直白:几乎没有人。
没有任何 AI 厂商承诺消费它。OpenAI 没有,Anthropic 没有,Google 没有,Perplexity 也没有——它们都没有任何官方文档声明自家系统会抓取或解析 llms.txt。Google 的态度公开而不客气:John Mueller 在 2025 年 4 月写道,“据我所知,没有哪家 AI 服务说过自己在用 LLMs.TXT(看看服务器日志就知道,它们连查都不查)。在我看来,这跟 keywords meta 标签差不多”;Gary Illyes 在 2025 年 7 月确认,Google 不支持它,也没有支持的计划。
服务器日志给出同样的结论。Ahrefs 在 2026 年 6 月检查了 137,000 个域名:97% 已发布的 llms.txt 文件在前一个月收到零次请求,即便是有过流量的那 3%,其中也只有约 1% 来自 AI 检索机器人。Evil Martians 梳理了自家站点两个月的日志:文件约 770 次被抓取,其中 37 次来自可识别的 AI 代理。Otterly 在 90 天内观察了 62,100 次 AI 机器人访问,其中 84 次落到 /llms.txt——只有一个普通内容页面所得的三分之一。SE Ranking 则用 300,000 个域名检验“有这个文件”与“被 AI 回答引用”之间是否相关:没有发现任何关系。
与此同时,采用率仍在攀升——从 2025 年 6 月约 4,100 个已发布文件,到一年后的 36,100 个,几乎九倍的增长,而这些文件几乎没有谁在读。发布者名单既亮眼又讽刺:Anthropic、Cloudflare、Zapier、Stripe 和 Vercel 都提供了一份,多数放在各自的文档域名上;Perplexity 发布了自己的 llms.txt,却从未声称读过别人的。
同一批日志里藏着一个真实信号,而它指向提案的另一部分:Evil Martians 发现 Claude Code 在 76% 的抓取中通过内容协商索取 markdown。机器确实偏爱干净的 markdown 而非 HTML——它们忽略的是那个索引文件,而不是这个想法。
| 说法 | 状态 | 依据 |
|---|---|---|
| AI 厂商会读取 llms.txt | 否——无人承诺 | 没有厂商文档这样声明;Google 明确拒绝(Mueller、Illyes) |
| AI 机器人在实践中会抓取该文件 | 几乎测不出来 | 97% 的文件零请求(Ahrefs,13.7 万个域名);两个月内可识别代理抓取 37 次(Evil Martians) |
| 有这个文件能提升 AI 引用 | 未发现效果 | SE Ranking,30 万个域名:与引用频率无相关性 |
| 发布方仍在采用它 | 是——而且很快 | 一年内从 4,100 个增至 36,100 个文件(Ahrefs);其中包括 Anthropic、Stripe、Cloudflare、Zapier |
| 机器偏爱 markdown 而非 HTML | 是——已实测 | Claude Code 在 76% 的抓取中索取 markdown(Evil Martians) |
我们为什么仍然维护一份
我们的站点提供 /llms.txt 以及按语言拆分的 llms-full 文件,而我们不为它们主张任何效果:我们没有任何证据表明某个助手是通过这张地图、而不是通过抓取和搜索索引找到我们内容的,我们也假定自家文件的表现不会好于实测平均值。那为什么还留着?
因为在我们的架构里,它不花任何成本,也不会腐坏。这个文件由构建页面、sitemap 和指南聚合页的同一个内容注册表生成:某篇指南上线或修改,llms.txt 就在同一个提交里更新。能自我维护的地图,是对“某天真有代理来读”这一未来的免费期权;需要手工维护的地图,则是一笔负债,会悄无声息地与网站失去同步。
在生产环境里真正跑一份,还会暴露那些评论文章跳过的工程约束。自从上线印地语版本以来,我们的 llms-full 导出已两次撑破体积上限——天城文在 UTF-8 下每个字符约占三个字节,即使印地语文本更短,同样的指南体积仍约为英文版的两倍——所以上限现在定在 300 KB,是最初的三倍。如果你的 llms-full.txt 大于模型的上下文预算,那你不过是把这个文件本该解决的问题原样复制了一遍。
这就是这个决定的诚实面貌:我们把它当作一笔零成本的下注来发布,并且如实这样描述它——它属于技术层,记录在我们那篇“我们如何在自己站点上做 GEO”的指南里,而不是排名杠杆。真正对引用有可测量影响的东西也写在那里:爬虫可访问性、可提取的页面、实体建设。
如何做一份不至于丢人的 llms.txt
如果 llms.txt 在你的技术栈里是免费的——一个插件、一个静态站点钩子、一个 CMS 模板——那么这就是规范里的 llms.txt 格式。
一个最小的 llms.txt 示例:一个 H1 写你的站点名称,随后一段引用块,用两三句代理可以直接引用的话说明这个站点是什么。若干 H2 小节——页面、指南、文档——每节是一串 markdown 链接,每条链接配一行说明。再加一个 Optional 小节,放代理可以跳过的内容。整个标准就这些。
有三种做法会让这个文件比不做更糟:
- 把它放在一刀切的 Disallow 后面。如果 robots.txt 屏蔽了机器人,它永远看不到这张地图。先解决访问,再谈导航——画地图之前,先检查爬虫开关。
- 把手上所有 URL 一股脑倒进去。这个文件唯一的理论价值在于筛选:一百条毫无区分的链接就是一份 sitemap,而 sitemap.xml 早就存在了。十个关键页面配上诚实的一行说明,胜过其他任何做法。
- 任它与网站脱节。手写的 llms.txt 描述着你早已重写过的页面,那正是 Mueller 拿来作比的 keywords meta 标签:一段无人核实的自我描述。要么从与页面相同的来源生成它,要么干脆不要。
相关问题
llms.txt 和 robots.txt 有什么区别?
职责完全不同。robots.txt 控制访问——哪些爬虫可以抓取哪些路径,而每家主流 AI 厂商都有文档说明自己遵守它(用户发起的抓取器有例外,我们在 robots.txt 指南中说明)。llms.txt 什么都不控制:它只是一份建议阅读清单,守规矩的机器人可以去查,而按目前的实测,几乎没有机器人会去查。先把访问权限做对;地图只是可选的点缀。
今天 llms.txt 对 SEO 或 AI 可见性有帮助吗?
没有可测量的效果:SE Ranking 检验了 300,000 个域名,未发现“有这个文件”与“被 AI 回答引用”之间存在关系,Google 也明确表示完全不使用该文件。真正推动引用的是本系列其余内容所讲的东西——爬虫可访问性、答案先行且可提取的页面、外部佐证——而我们关于衡量 AI 可见性的指南会告诉你如何用自己的数据验证其中任何一项。把 llms.txt 当作实验,永远不要当作方案。
如何创建 llms.txt 文件?
简短回答:不要手写。如果你的平台能从内容自动生成——文档托管服务会自动做,多数框架和 CMS 也有插件——把它打开,你就免费获得一个始终同步的文件。十来个页面的小站手写尚可接受,那种规模下维护成本可以忽略;规模再大一些,就把它接到构建页面的同一个数据源上。
要不要同时发布 llms-full.txt?
只有在它是自动生成的情况下才值得。它并不属于规范,而是把全部内容装进一个 markdown 文件的约定,主要用途是把一个站点的文档手动粘贴进 AI 工具的上下文。注意体积:超过几百 KB,你就在冲爆这个文件本该服务的上下文窗口。我们的文件正是为此设了上限,并按语言拆分。
AI 厂商最终会采用 llms.txt 吗?
不知道,而且这个趋势可以两头解读:一年里发布方的采用量增长了近九倍,而厂商的承诺始终为零,Google 更是直接说不。提案中唯一有实测牵引力的部分是 markdown 本身——只要页面提供 .md 版本,代理已经会主动索取。如果规范里有什么能留下来,我们押的是干净、机器可读的页面,而不是那个索引文件。
相关指南
来源
- 01我们的指南:如何为 AI 爬虫配置 robots.txt?
- 02我们的指南:在自己的网站上如何实操 GEO?
- 03我们的指南:如何衡量 AI 可见性与引用?
- 04llmstxt.org——llms.txt 提案(Jeremy Howard,2024 年 9 月)
- 05Search Engine Journal——Google 的 Mueller:llms.txt 与 keywords meta 标签相当(2025 年 4 月)
- 06Ahrefs——llms.txt 研究:97% 的文件没有收到任何请求(137,000 个域名,2026 年 6 月)
- 07Evil Martians——两个月 LLM 流量实测(2026 年 7 月)
- 08SE Ranking——llms.txt 对 AI 引用没有影响(300,000 个域名,2025 年 11 月)
- 09Otterly——llms.txt 实验:90 天 AI 机器人日志(2026 年 2 月)
- 10Mintlify——为托管文档自动生成 llms.txt(2024 年 11 月)
- 11Ahrefs——什么是 llms.txt,你需要它吗?(2026 年 6 月更新)
// 分享