GEO资讯

别把AI爬虫挡在门外:官网robots.txt自查

发布于 2026/8/13 61 次阅读
别把AI爬虫挡在门外:官网robots.txt自查

别把 AI 爬虫挡在门外:官网 robots.txt 自查

不少企业官网内容做了优化,在 AI 搜索里却始终不出现。排查到最后,问题常常出在一个被忽视的文件上——robots.txt。过去一个月,多家 SEO 机构在技术审计里发现同一类问题:网站要么把 AI 爬虫整个屏蔽,要么配置顺序写反,本想让 AI 抓的内容反而抓不到。

一、为什么这个文件突然重要了

过去几年,robots.txt 只是搜索引擎爬虫的事,企业基本不用管。现在情况变了:ChatGPT、Claude、Perplexity、豆包、DeepSeek 这些 AI 产品在回答问题时,会实时抓取网页作为依据,而这些抓取同样遵守 robots.txt。也就是说,这个文件现在直接决定 AI 能不能读到你的官网。2026 年的统计显示,约 22% 的全球头部网站已经在 robots.txt 里主动屏蔽了 GPTBot;而在另一项针对企业站的审计中,被检查的站点里有相当比例存在误屏蔽 AI 爬虫的情况。

二、先分清两类爬虫

AI 生态里的爬虫至少分两类,作用完全不同:

  • 训练爬虫:GPTBot(OpenAI 训练模型)、ClaudeBot(Anthropic)、Bytespider(字节跳动,豆包相关内容)、Google-Extended(控制已抓取内容能否用于 Gemini 训练)。
  • 搜索引用爬虫:OAI-SearchBot(ChatGPT 搜索的引用索引)、Claude-SearchBot(Claude 搜索,2026 年 4 月新增)、PerplexityBot(Perplexity 引用索引)、Googlebot(谷歌 AI Overviews 同样走它)。

关键区分:屏蔽 GPTBot,不影响 ChatGPT 搜索引用;屏蔽 OAI-SearchBot,官网才会从 ChatGPT 的答案里彻底消失。两者相互独立,可以只允许搜索、拒绝训练。

三、三个最常见的误配置

  • 通配符误伤:写了 User-agent 星号配 Disallow 根目录,又没有单独放行 AI 爬虫,等于把 GPTBot、ClaudeBot、PerplexityBot 全部挡死。
  • 顺序写反:先写 User-agent: GPTBot 配 Allow,再写 User-agent 星号配 Disallow。按最长匹配规则,最终只放行了 GPTBot,其他所有爬虫(包括 Googlebot)全被屏蔽,这比不放行更糟。
  • 误解 Google-Extended:它本身不抓取页面,只回答"已抓取内容能否用于 Gemini 训练",屏蔽它不影响谷歌自然排名和 AI Overviews。

爬虫只认最长匹配的用户代理组,组内再按最长路径匹配。手工改 robots.txt 前,建议对照各家官方文档核对用户代理名称,别凭记忆写。

四、推荐的配置思路

如果希望官网进入 AI 答案池,核心原则是明确放行搜索引用爬虫,训练爬虫可按意愿单独处理。参考做法:对 OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot 分别写 Allow,对 GPTBot、ClaudeBot 这类训练爬虫,若在意内容被用于训练可单独写 Disallow,不影响搜索引用。国内环境还要留意 Bytespider(字节跳动,豆包相关内容)和百度系爬虫,同样单独列出放行规则,避免被通配符规则误伤。

判断投入产出有个参考:一项基于 15 万条引用记录的研究显示,约 76.95% 被 AI 引用的网址并不在自然搜索前十名。换句话说,AI 引用靠的是"抓得到",而不是"排名高"。官网被 robots.txt 挡在门外,等于主动退出引用池,内容做得再好也白搭。

五、十分钟自查动作

  1. 打开域名下的 robots.txt,检查 GPTBot、ClaudeBot、PerplexityBot、OAI-SearchBot 是否出现在 Disallow 名单里。
  2. 查看服务器日志,确认这些用户代理近期有没有抓取记录;完全没有,说明配置或入口有问题。
  3. 修改前先备份原文件,改完用爬虫检测工具复核,确认规则按预期生效。

给中小企业的建议很直接:别一上来就屏蔽所有 AI 爬虫。如果担心内容被拿去训练,可以只拒绝训练爬虫、保留搜索引用爬虫;如果官网本身没有敏感内容,直接全部放行即可。robots.txt 是官网进入 AI 答案池的第一道门,改动不花钱,直接影响 AI 是否"看得见"你。

信息来源

  • knownagents.com《What Is GPTBot? User Agent & Robots.txt》,2026-08-03
  • dev.to《GPTBot, ClaudeBot, PerplexityBot: which AI crawlers can read your site》,2026-08-03
  • organikpi.com《Robots.txt for AI Crawlers in 2026: Allow, Block, or Negotiate?》,2026
  • digitalarka.com《Core Web Vitals & Technical SEO Guide (August 2026)》,2026-08