Top 1 万网站的 robots.txt 调查:18.8% 屏蔽 AI 爬虫,但多数只挡训练、不挡搜索(附数据)
我们解析了全球前 10,000 个网站的 robots.txt 和 llms.txt。18.8% 的站点至少屏蔽一个 AI 爬虫,GPTBot 被屏蔽的比例是 OpenAI 搜索爬虫的 2.5 倍;37 个站点只屏蔽了 Anthropic 已停用的旧标识。附按排名与国家域名的对比与 CSV。
越来越多网站在 robots.txt 里屏蔽 AI 爬虫,但 AI 爬虫并不是一类:有的抓数据训练模型,有的为 ChatGPT、Perplexity 这类 AI 搜索实时抓取网页。挡错了,可能既没挡住训练,又把自己从 AI 搜索里拿掉了。
我们在 2026 年 9 月 28 日抓取了 Tranco 前 10,000 个网站的 robots.txt 和 llms.txt,按 RFC 9309 标准逐一判断 15 个 AI 爬虫和 2 个传统搜索爬虫能否抓取网站内容。
一、核心发现
- 在 4,592 个发布了 robots.txt 的站点中,18.8% 至少屏蔽了一个 AI 爬虫(同时放行 Googlebot),只有 2% 屏蔽了全部 15 个 AI 爬虫。
- 训练爬虫被屏蔽得最多:CCBot 14.3%、GPTBot 13.4%、Bytespider 13.3%、ClaudeBot 12.3%。
- AI 搜索爬虫被屏蔽得少得多:OpenAI 的 OAI-SearchBot 只有 5.3%,是 GPTBot 的五分之二。屏蔽 GPTBot 的 615 个站点中,373 个(60.7%)仍放行 OAI-SearchBot。
- 9.4% 的站点属于“挡训练、放搜索”:屏蔽了至少一个训练爬虫,但放行所有 AI 搜索爬虫。
- 排名越靠前越爱屏蔽:前 1,000 名中 28.1% 屏蔽 AI 爬虫,5,001–10,000 名是 16.7%。德国 .de 站点高达 40%。
- 37 个站点只屏蔽了 Anthropic 已停用的旧标识 anthropic-ai,却没有屏蔽现在实际使用的 ClaudeBot,例如 espn.com、science.org、trustpilot.com。
- 10.7% 的可访问站点提供了 llms.txt,其中至少 30 个是由 WordPress 插件 Yoast SEO 自动生成的。
二、各爬虫被屏蔽的比例
分母为发布了 robots.txt 的 4,592 个站点;“屏蔽”指首页或普通内容页被禁止抓取,且不含同时屏蔽 Googlebot 的站点。
| 爬虫 | 公司 | 用途 | 被屏蔽 |
|---|---|---|---|
| CCBot | Common Crawl | 训练 | 14.3% |
| GPTBot | OpenAI | 训练 | 13.4% |
| Bytespider | ByteDance | 训练 | 13.3% |
| ClaudeBot | Anthropic | 训练 | 12.3% |
| meta-externalagent | Meta | 训练 | 10.6% |
| Google-Extended | 训练 | 10.5% | |
| Applebot-Extended | Apple | 训练 | 9.8% |
| PerplexityBot | Perplexity | 搜索 | 8.9% |
| ChatGPT-User | OpenAI | 用户触发 | 7.4% |
| OAI-SearchBot | OpenAI | 搜索 | 5.3% |
| Claude-SearchBot | Anthropic | 搜索 | 5.2% |
| Googlebot(对照 / baseline) | — | 3.3% |
三、按排名
| 排名 | 有 robots.txt 的站点 | 屏蔽任一 AI 爬虫 | 屏蔽 GPTBot |
|---|---|---|---|
| 1–1,000 | 506 | 28.1% | 19.2% |
| 1,001–5,000 | 1,910 | 18.7% | 13.6% |
| 5,001–10,000 | 2,176 | 16.7% | 11.9% |
四、常见的配置错误
- 只写旧标识:anthropic-ai 已不再使用,要屏蔽 Anthropic 的训练爬虫应写 ClaudeBot。
- 只放行首页:像 Disallow: / 加 Allow: /$ 这样的写法,只开放首页、封掉所有内容页,效果等同于整站屏蔽。
- 以为挡 GPTBot 就退出了 ChatGPT:GPTBot 负责训练,ChatGPT 搜索用的是 OAI-SearchBot,用户在对话里让 ChatGPT 打开网页时用的是 ChatGPT-User,三者要分开写。
- 把专门规则写在 * 后面也没问题:按 RFC 9309,爬虫只看点名自己的那一组规则,找不到才用 *,和书写顺序无关。
# 挡训练、放 AI 搜索的一种写法
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
User-agent: *
Disallow: /admin/五、方法与局限
- 站点:Tranco 榜单(ID 64X3X,2026-09-28 获取)前 10,000 个注册域名;3,687 个无法访问(多为 CDN、API 等没有网站的域名,或返回 5xx),不计入统计。
- 抓取:2026-09-28,先请求 https,失败再试 http,跟随跳转;User-Agent 为 CallAI-Research/1.0。
- 判定:按 RFC 9309 实现——点名分组覆盖 *、同名分组合并、最长匹配优先、Allow 在平局时胜出,支持 * 和 $ 通配。
- robots.txt 只是君子协定,屏蔽不代表爬虫一定遵守;部分站点还会在服务器或 CDN 层按 User-Agent 拦截,本研究不涉及。
- llms.txt 判定:返回 2xx、不是 HTML、第一行以 “# ” 开头。
站内推荐实用工具
检查你的 robots.txt
免费 Robots.txt 检查器:逐个检测 Googlebot、GPTBot、ClaudeBot 等爬虫能否抓取指定路径。