别迷信llms.txt,AI引用不吃这一套
过去一年,llms.txt 被不少服务商包装成"AI 时代的 sitemap":放一个文件在网站根目录,列出重点页面,AI 就会优先读你。真实情况远没有那么美好。多家机构和搜索引擎官方的实测结论一致:这个文件对 AI 搜索引用基本不起作用,别把官网的 AI 优化押在它身上。
数据说了什么
最常被引用的是 Ahrefs 在 2026 年 6 月发布的报告:它对约 13.7 万个有流量的域名做了分析,约 28% 的网站发布了 llms.txt,其中 97% 的文件在整个统计期内没有收到任何爬虫请求;在少数被请求的文件里,AI 检索爬虫只占约 1%。也就是说,绝大多数 AI 爬虫根本不会来读这个文件。
搜索引擎一方也把话说得很明白。Google 的 Gary Illyes 在 Search Central Live 上确认 Google 不支持该格式,John Mueller 把它类比为早已失效的 keywords meta 标签,Google 2026 年关于生成式 AI 功能的官方说明也写明:不需要为 AI 功能创建任何新文件,Search 不读 llms.txt。
为什么它不工作
机制上很好理解。AI 搜索爬虫发现网页的方式和传统爬虫一样,沿链接抓取、直接读 HTML,不会专门去找一个大多数网站都不存在的文件。而且 llms.txt 是网站自己写的自我介绍,读它的人还得逐页核对内容是否属实,省不了多少事——搜索引擎二十年前就因为这个教训放弃了 keywords 标签。更有风险的是,文件长期不维护会指向过期页面,反而误导少数真的来读它的工具。
它真的完全没用吗
有一个真实且重要的用途:给开发者工具和编程助手当文档索引。Cloudflare、Anthropic、Vercel、Mintlify 这些技术公司都在用,让 Cursor、Claude Code 这类工具快速定位文档,能明显省 token。Originality.ai 的追踪也显示,llms.txt 的发布量从 2025 年 6 月的约 4088 个涨到 2026 年 5 月的约 3.6 万个,增长确实快。
但对大多数企业官网来说,追求的是被 AI 答案引用、带来曝光和询盘,这条路 llms.txt 帮不上忙。正确的做法是回到基本功:保证页面可被抓取、用结构化数据把实体讲清楚、把事实和数据写成"AI 读得懂、敢引用"的陈述句。如果一个服务商把"帮你放好 llms.txt"当作 AI 优化的核心卖点,要小心。
三个文件,三种职责,别混为一谈
很多人把根目录的几个文件搞混。robots.txt 控制哪些爬虫可以访问什么,是"准入规则";sitemap.xml 列出网站有哪些页面,是"目录清单";llms.txt 只是自己写的"阅读建议"。前两个有搜索引擎和主流 AI 爬虫在执行,llms.txt 连提出者自己都定位为社区建议而非规范,没有任何主流 AI 产品正式承诺会读它。把三者并列讨论,本身就高估了 llms.txt 的地位。
判断一个技巧值不值得投入,可以问一句:它改变的是机器能不能读好你的网站,还是只是试图影响机器说什么?前者是资产,后者多数是过路费。真要自查,翻一下服务器日志,看看有多少请求打到了 /llms.txt,两分钟就能验证它对你有没有用——大多数网站的答案是零。河北极欧智推科技有限公司 GEO 的建议是,把精力花在内容与结构的真实改造上,而不是追逐一个搜索引擎官方明确不读的文件。

