一句话答案: Cloudflare 于 2026 年 7 月 1 日宣布,自 2026 年 9 月 15 日起将 AI 爬虫拆分为 Search / Agent / Training 三类,并对新接入域名、现有账户新增站点及所有免费版账户启用新默认策略——在展示广告的页面上默认拦截 Training 与 Agent 爬虫,Search 爬虫默认放行。更麻烦的是,Googlebot 这类"混用爬虫"会按最严格的规则处理。如果你不做任何事,你的站点有可能在 9 月 15 日之后同时失去 AI 引用资格和部分 Google 抓取。
目录
- [一、发生了什么:三分类与新默认值](#一发生了什么三分类与新默认值)
- [二、为什么这件事对出海企业格外重要](#二为什么这件事对出海企业格外重要)
- [三、必须先搞清楚的概念:训练爬虫 ≠ 搜索爬虫](#三必须先搞清楚的概念训练爬虫--搜索爬虫)
- [四、主流 AI 爬虫对照表](#四主流-ai-爬虫对照表)
- [五、三种策略姿态,选一种](#五三种策略姿态选一种)
- [六、9 月 15 日前必须做的 7 件事](#六9-月-15-日前必须做的-7-件事)
- [七、可直接复制的 robots.txt 模板](#七可直接复制的-robotstxt-模板)
- [八、四个最常见的踩坑场景](#八四个最常见的踩坑场景)
- [九、常见问题 FAQ](#九常见问题-faq)
一、发生了什么:三分类与新默认值
Cloudflare 在 2026 年 7 月 1 日的第二届 "Content Independence Day" 更新中,废弃了 2025 年 7 月推出的"一键屏蔽所有 AI 机器人"开关,改为三个独立控制项:
| 分类 | 定义 | Cloudflare 的默认立场 |
|---|---|---|
| Search(搜索爬虫) | 抓取并索引内容,会带回转介流量 | 放行。前提是站点能获得流量或补偿 |
| Agent(代理爬虫) | 代表用户实时执行任务,如 ChatGPT-User、Gemini、Claude 的浏览操作 | 广告页面默认拦截 |
| Training(训练爬虫) | 批量抓取内容用于训练或微调模型,内容被永久嵌入模型 | 广告页面默认拦截,限制最严 |
新默认值的适用范围(2026-09-15 生效):
- 新接入 Cloudflare 的域名
- 现有账户下新增的站点
- 所有未修改过设置的免费版账户
现有客户可以在 9 月 15 日之前,通过 zone 的 Security 设置主动退出新默认值,保留当前行为。
这不是小范围调整。Cloudflare 位于大约 20% 的网站流量之前,且超过 100 万客户已启用过它 2025 年那个一键屏蔽开关——这些人当中的很多,并不清楚开关在 9 月 15 日之后意味着什么。
二、为什么这件事对出海企业格外重要
三个理由:
1. 你的官网可能正在被"默认拦截",而你完全不知道。 Cloudflare 网络上的研究发现,相当一部分站点在 CDN 层意外拦截了主流 AI 爬虫,而它们的 robots.txt 明明写着允许。两层配置必须一致,只改一层等于没改。 对出海企业来说,这意味着你可能花了半年做 GEO 内容,却从未被任何 AI 读到过。
2. 你可能会误伤 Googlebot。 Cloudflare 自己的数据显示,36% 的爬虫活动来自混合用途爬虫——同一个 bot 同时承担搜索和训练任务。Googlebot 正是典型:它同时为搜索索引和 AI 训练抓取内容。按新规,混用爬虫适用最严格的那条规则。所以:
如果你(或你的前任运维)曾经打开过"屏蔽 AI 训练"的开关,9 月 15 日之后,Googlebot 在带广告的页面上也会被一并拦截。 Applebot、Bingbot 同理。
对靠 Google 自然搜索获客的外贸站,这可能是灾难级的配置错误。
3. 中国出海企业的技术栈往往是外包的。 大量外贸独立站由建站服务商或代运营团队搭建,Cloudflare 账户可能挂在服务商名下、用的是免费版、五年没人碰过设置。这类站点恰好完全命中新默认值的适用范围。
三、必须先搞清楚的概念:训练爬虫 ≠ 搜索爬虫
这是整件事里最重要、也最常被搞错的一点。
主流 AI 公司已经把"训练"和"搜索"拆成了两个独立的爬虫,各有各的 user-agent,可以分别控制。
- GPTBot ≠ OAI-SearchBot
- ClaudeBot ≠ Claude-SearchBot
- Amazonbot ≠ Amzn-SearchBot
这个区分带来一个非常关键的推论:
拦截某家公司的训练爬虫,并不会让你从这家公司的 AI 搜索答案里消失。
屏蔽 GPTBot,你仍然可以通过 OAI-SearchBot 被 ChatGPT Search 引用;屏蔽 ClaudeBot,Claude-SearchBot 依然工作。训练和搜索是两条不同的管道。
于是"默认最优解"自然浮现:拦训练,放搜索。
不过对绝大多数出海企业,我给的建议更激进一点——全放行。理由在下一节。
一个必须知道的成本数字
Cloudflare 在 2025 年 6 月测算的抓取/转介比例(crawl-to-referral ratio)解释了这场博弈的本质:Google 约 14:1,OpenAI 约 1700:1,Anthropic 约 73000:1;同期 AI 训练爬虫流量在前六个月增长了 65%。
翻译成人话:AI 公司抓走你 1700 次内容,才给你送回 1 个访客。 对大型媒体,这是必须谈判的商业问题。但对一个月流量几千的外贸站,带宽成本可以忽略不计,被引用的价值远高于被抓取的成本——所以出海企业和媒体的最优策略完全不同,不要照抄媒体的做法。
四、主流 AI 爬虫对照表
| User-agent | 归属 | 类型 | 出海企业建议 |
|---|---|---|---|
GPTBot | OpenAI | 训练 | 放行(想被 ChatGPT 认识) |
OAI-SearchBot | OpenAI | 搜索 | 必须放行 |
ChatGPT-User | OpenAI | 代理(用户触发) | 必须放行 |
ClaudeBot | Anthropic | 训练 | 放行 |
Claude-SearchBot | Anthropic | 搜索 | 必须放行 |
Claude-User | Anthropic | 代理(用户触发) | 必须放行 |
PerplexityBot | Perplexity | 搜索索引 | 必须放行 |
Perplexity-User | Perplexity | 代理 | 放行 |
Google-Extended | Gemini 训练控制 | 放行 | |
Googlebot | 混用(搜索 + 训练) | 绝对放行 | |
Applebot-Extended | Apple | 训练控制 | 视情况 |
Bingbot | Microsoft | 混用 | 绝对放行 |
Bytespider | 字节跳动 | 训练 | 视带宽情况 |
CCBot | Common Crawl | 训练 | 可拦截(转介价值最低) |
注意: user-agent 名称与行为会变化,本表基于 2026 年年中各家公开文档。上线前请核对官方最新说明。
五、三种策略姿态,选一种
| 姿态 | 做法 | 适合谁 |
|---|---|---|
| 开放(推荐) | 放行所有主流 AI 爬虫 | 绝大多数出海企业、B2B 工厂、SaaS、咨询机构——你的生意依赖被找到 |
| 选择性 | 放行搜索爬虫,拦截纯训练爬虫(CCBot,可选 GPTBot / Google-Extended) | 有独家数据、原创研究、付费内容的企业 |
| 收紧 + 变现 | CDN 层拦截 + Pay Per Crawl / 授权谈判 | 内容本身就是产品的媒体、数据库、行业报告方 |
如果你在做 GEO,答案几乎一定是"开放"。 屏蔽 AI 搜索与代理爬虫,等于主动放弃被 AI 引用的资格——这和你花钱做 GEO 的目标直接冲突。
六、9 月 15 日前必须做的 7 件事
1. 确认你的站点到底在不在 Cloudflare 后面,账户在谁手里
很多外贸站是服务商代建的,企业自己没有 Cloudflare 账户访问权。先把账户要回来。 命令行快速判断:
dig +short yourdomain.com
curl -sI https://yourdomain.com | grep -i "server\|cf-ray"返回中出现 cloudflare 或 cf-ray 头,说明在 Cloudflare 后面。
2. 检查 zone 的 Security 设置,确认当前 AI 爬虫策略
进入 Cloudflare Dashboard → 对应 zone → Security → 查看 AI 爬虫相关控制项当前状态。特别注意历史遗留的"Block AI Bots"开关是否处于开启状态——这是最常见的隐形雷。
3. 决定是否退出新默认值
如果你的站点带广告(包括 AdSense、联盟广告代码),且你希望保持现状,需要在 9 月 15 日前主动 opt out。如果你的站点不带广告,新默认值对你影响有限,但仍建议显式确认配置而非依赖默认。
4. 重写 robots.txt,训练与搜索分开配置
模板见下一节。核心原则:先明确列出你要放行的搜索与代理爬虫,再处理训练爬虫。
5. 让两层配置对齐
robots.txt(应用层的意愿声明)和 CDN / WAF(网络层的实际执行)必须说同一件事。robots.txt 已标准化为 RFC 9309,但它只是一个自愿遵守的请求,没有任何强制力。真正的执行发生在服务器或 CDN 层。
6. 实际验证,不要相信配置页面
从 Cloudflare 网络之外的机器发起请求,带上目标 user-agent:
# 验证 OpenAI 搜索爬虫是否被放行
curl -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)" \
-I https://yourdomain.com/
# 验证 Anthropic 搜索爬虫
curl -A "Mozilla/5.0 (compatible; Claude-SearchBot/1.0)" \
-I https://yourdomain.com/
# 验证 Perplexity
curl -A "Mozilla/5.0 (compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)" \
-I https://yourdomain.com/期望结果是 `HTTP/2 200`。 如果返回 403、503 或挑战页面,说明网络层在拦截,需要加白名单规则。
7. 建立日志监测,把爬虫访问纳入常规报表
在服务器日志或 Cloudflare Analytics 中按 user-agent 分组统计,至少每月看一次:
# Nginx 日志示例:统计主流 AI 爬虫的抓取次数
awk -F'"' '{print $6}' /var/log/nginx/access.log \
| grep -Ei "GPTBot|OAI-SearchBot|ClaudeBot|Claude-SearchBot|PerplexityBot|Google-Extended|Bytespider" \
| sed -E 's/.*(GPTBot|OAI-SearchBot|ClaudeBot|Claude-SearchBot|PerplexityBot|Google-Extended|Bytespider).*/\1/' \
| sort | uniq -c | sort -rn没有抓取记录 = 不可能被引用。 这是 GEO 排查的第一步,比看任何监测工具都直接。
七、可直接复制的 robots.txt 模板
模板 A:开放姿态(推荐给绝大多数出海企业)
# ===== AI 搜索与代理爬虫:全部放行,保留被引用资格 =====
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
# ===== AI 训练爬虫:同样放行(希望模型认识你的品牌) =====
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
# ===== 传统搜索引擎:绝对不要碰 =====
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
# ===== 通用规则:保护后台与交易路径 =====
User-agent: *
Disallow: /admin/
Disallow: /checkout/
Disallow: /cart/
Disallow: /account/
Disallow: /*?s=
Allow: /
Sitemap: https://yourdomain.com/sitemap.xml模板 B:选择性姿态(有独家数据的企业)
在模板 A 基础上,替换训练爬虫段落:
# ===== 拒绝训练,但保留搜索引用资格 =====
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /⚠️ 使用模板 B 前请务必确认: 你的 Cloudflare 设置中,"屏蔽训练爬虫"不会连带屏蔽 Googlebot。这正是 9 月 15 日新规最大的陷阱。
配套:加一个 llms.txt
llms.txt 是放在域名根目录、用于向 AI 指引你最有价值内容的纯文本文件。目前采用率约 10% 左右,各家 AI 的支持程度不一,属于"成本极低、上限未知"的动作,建议做但不要指望它救命。
# llms.txt
# YourCompany — 中国 XX 制造商
> 我们是一家位于 XX 的 XX 生产企业,成立于 20XX 年,主要面向欧美市场提供 XX 产品的 OEM/ODM 服务。
## 核心页面
- [公司简介](https://yourdomain.com/about): 产能、认证、工厂信息
- [产品目录](https://yourdomain.com/products): 完整产品线与技术参数
- [技术资料](https://yourdomain.com/resources): 选型指南、参数对照表、常见问题
- [认证资质](https://yourdomain.com/certifications): ISO、CE、UL 等证书清单
## 联系方式
- 询盘: https://yourdomain.com/contact八、四个最常见的踩坑场景
场景 1:robots.txt 写了 Allow,但 AI 就是读不到。 网络层在拦截。robots.txt 是意愿声明,CDN / WAF 才是执法者。用第 6 步的 curl 命令验证,返回非 200 就去查 CDN 规则。
场景 2:放行了 PerplexityBot,Cloudflare 仍然拦。 2025 年 8 月,Cloudflare 因隐蔽抓取争议将 Perplexity 移出 Verified Bots 名单(Perplexity 对此有异议)。截至 2026 年初 Perplexity 正在逐步恢复,但部分 zone 仍可能继承网络层的信誉拦截。检查 Cloudflare 的状态页与 AI Crawl Control 变更日志,别先怀疑自己的规则写错了。
场景 3:放行了 ClaudeBot,Claude 还是读不到页面。 ClaudeBot 是抓取用的 user-agent,Claude 的联网检索走的是另一条路径。同时放行 `ClaudeBot`、`Claude-SearchBot`、`Claude-User` 三个,覆盖当前与近期的所有情况。同类问题也存在于 OpenAI 生态。
场景 4:某个爬虫把源站打崩了。 AI 爬虫确实可能很重。如果单个爬虫贡献了超过 5% 的源站请求,加限速规则而不是直接封禁:Cloudflare WAF → Rate Limiting Rules,对匹配该 user-agent 的请求设置每分钟 60 次上限。它照样能拿到新鲜内容,你的源站不会被打爆。
九、常见问题 FAQ
Q1:我不是 Cloudflare 用户,这件事和我有关吗? 直接影响没有,但间接影响很大。Cloudflare 位于约 20% 的网站前面,它的三分类框架(Search / Agent / Training)很可能成为行业事实标准,其他 CDN 与主机商会跟进。此外,你的外链来源站点、你投稿的媒体,可能都在 Cloudflare 后面——它们的策略变化会影响你的信源链路。
Q2:屏蔽 AI 训练会让我从 ChatGPT 里消失吗? 不会。训练和搜索是两条独立管道,屏蔽 GPTBot 之后,OAI-SearchBot 仍可让你出现在 ChatGPT Search 的答案里。但屏蔽搜索与代理爬虫会——那才是真正让你消失的操作。
Q3:robots.txt 有法律效力吗? 没有。robots.txt 已标准化为 RFC 9309,但本质上是一个自愿遵守的请求,不具备强制力,也不是安全控制手段。主流爬虫(Googlebot、GPTBot、ClaudeBot)通常会遵守,但用户实时触发的抓取行为在各家的处理方式并不统一——真正的强制执行只发生在服务器或 CDN 层。
Q4:Pay Per Crawl 值得考虑吗? 对绝大多数出海企业:不值得。Cloudflare 的 Pay Per Crawl 使用 HTTP 402(Payment Required)响应,让站点可以向 AI 公司收费而不是免费提供内容,并正在向按使用付费的方向演进。但它的经济性建立在"内容本身就是产品"的前提上。对一个靠内容获客的外贸站,你要的是被引用带来的询盘,不是每次抓取几分钱。
Q5:这件事和 GEO 优化的优先级关系是什么? 它是 0 号前置条件。爬虫进不来,后面所有的结构化改造、FAQ 建设、原创数据都是白做。建议把"爬虫可达性检查"放进每个季度的 GEO 审计清单第一项。
相关阅读
- 《llms.txt 到底有没有用?2026 年的证据与建议》
- 《如何自查 AI 可见度?一份免费的 15 项审计清单》
- 《官网信息架构如何调整以适配 AI 抓取》
- 《出海企业搜索渠道全景(2026)》
- 《多语言 AI 可见度》
本文技术细节基于 Cloudflare 2026 年 7 月 1 日公告及 OpenAI、Anthropic、Perplexity、Google、Apple、Common Crawl 的公开爬虫文档。爬虫 user-agent 与平台策略变动频繁,配置上线前请核对各家官方最新文档。
