AI爬虫分三类,官网别一刀切处理
翻服务器日志,你会看到 GPTBot、ClaudeBot、OAI-SearchBot、Bytespider 一堆名字。很多教程只教你"放行或屏蔽",但 AI 爬虫根本不是一种东西。按用途分,它们有三类,管理策略完全不同——一刀切屏蔽,可能顺手把自己从 AI 答案里删掉了。
三类爬虫,三种后果
- 训练型爬虫。GPTBot、ClaudeBot、Google-Extended、CCBot、Bytespider 等,抓取内容用于训练未来模型。屏蔽它们,不影响 AI 现在给出的答案,只影响你退出未来的训练语料。
- 检索型爬虫。OAI-SearchBot、Claude-SearchBot、PerplexityBot、Meta-WebIndexer 等,建立实时索引,AI 回答时从中检索并引用。屏蔽这类,你的网站会直接从 AI 答案里消失,这是最需要放行的。
- 用户触发型。ChatGPT-User、Claude-User、Perplexity-User 等,用户点名让助手读取某个页面时发起。多数厂商声明"用户主动请求时 robots.txt 规则可能不适用"——想靠 robots.txt 完全拦住这类抓取,本来就不现实。
OpenAI 官方文档里有句很直白的话:网站管理员可以允许 OAI-SearchBot 以便内容出现在搜索结果中,同时禁止 GPTBot 表示内容不用于训练。训练和引用,是两笔账,别混在一起算。
先确认是谁在抓,再决定放不放
用户代理字符串可以随意伪造,不能当身份证明。2026 年 8 月有人实测了各大厂商公布的官方 IP 列表:Googlebot 的 315 个前缀几乎每日更新,ChatGPT-User 的 226 个前缀当天更新,而 PerplexityBot 只有 8 个前缀、超过一年半没更新。验证爬虫真伪,正确做法是把来源 IP 对回厂商官方发布的 CIDR 列表,或用反向 DNS 核对;更省事的是在 CDN 或防火墙层面做边缘管理,不依赖爬虫自觉。另外,安全社区已报告有人冒用 ClaudeBot、ChatGPT-User 身份扫描网站敏感文件,看到熟悉的名字也别放松警惕。
行业平台的默认也在收紧:Cloudflare 2026 年 7 月初宣布把 AI 爬虫按 Search、Agent、Training 三分类管理,9 月 15 日起对新域名的广告页面默认屏蔽 Training 和 Agent 类爬虫,检索类保持放行。
屏蔽前先算一笔账
同样是在 8 月,有分析用微软 Clarity 的数据提醒大家:某些目录型网站的 AI 爬虫抓取量和回流流量严重不成比例,但这个"难看的比例"并不构成屏蔽理由——因为 AI 引荐的流量往往不带着 AI 的来源标识出现,客户可能隔几天才直接访问,屏蔽爬虫等于把已经到嘴边的曝光掐掉。合理的做法是按运营商分开看数据:有的平台只抓取不回流,有的平台带来的访客质量很高,两类应该区别对待,而不是一个开关全关掉。
官网实操三步
- 查服务器或 CDN 日志,按用户代理分组,确认到底谁在抓、抓了哪些页面。
- 检索型爬虫一律放行;训练型按商业判断决定;对不守规矩的个别爬虫做速率限制,而不是全站屏蔽。
- 别用"User-agent: * Disallow: /"一把梭,定期核对官方 IP 列表,新爬虫名字每年都在变。
AI 爬虫管理的关键不是"防",而是"分清"。企业官网在 AI 生态里的位置,取决于检索型爬虫能不能顺利读到内容。河北极欧智推科技有限公司 GEO 的建议是:把放行的重点放在检索型爬虫上,同时用日志和官方 IP 列表建立基本监控,既保住被引用的资格,也不让无意义的抓取拖垮服务器。
信息来源
- Digital Applied《AI Bot Verification and Edge Enforcement: 2026 Playbook》,2026-08,访问链接
- Navoto《AI Crawlers: What They Are, How They Work, and How to Manage Them》,访问链接
- Dev.to(Umesh Malik)《How to Verify AI Crawler IPs: 3 Lists Are Over a Year Stale》,2026-08-13,访问链接
- Fokal《AI User Agents: How to Read Them, Verify Them, and Control Them》,访问链接
- Rosh Media《Microsoft Clarity's AI Scrape-to-Referral Ratio》,2026-08-13,访问链接

