封禁 GPTBot,并不会让你从 ChatGPT 的答案里消失
这是这项检测里最常被弄反的一条。OpenAI、Anthropic、Perplexity 三家都把爬虫分成三层,各层用途不同:
训练型(GPTBot、ClaudeBot、CCBot、Amazonbot、Applebot-Extended)只采集训练语料。封禁它们是一个版权决定,与你能不能被引用无关——所以我们不给这一层计分,只如实呈现状态。
检索型(OAI-SearchBot、Claude-SearchBot、PerplexityBot、Bingbot、Googlebot)为搜索回答建索引。封禁其中任何一个,等于在那家 AI 的答案里直接消失——这一层封禁一律判定为失败。
用户触发型(ChatGPT-User、Claude-User、Perplexity-User)只在用户提问时实时抓取。封禁只影响那一次对话,判定为警告。
把三者混为一谈,是目前大量 GEO 文章共同的错误。一份把「GPTBot 被封」写成「你在 ChatGPT 里不可见」的报告,会让你去改一件根本不影响结果的事。
管 Google AI 概览的是 Googlebot,不是 Google-Extended
Google 这一家最容易认错门。直觉会以为带 Extended 的那个负责 AI,但官方文档说的正相反。
Google 在《AI Features and Your Website》里写:AI 已内建于 Search、是 Search 运作方式的一部分,因此 robots.txt 中对 Googlebot 的指令,就是站长用来管理「站点如何为 Search 被抓取」的控制项。AI 概览与 AI Mode 依赖 Search 索引,所以封禁 Googlebot 等于同时退出 AI 概览。
而 Google-Extended,官方明确写着它不影响站点在 Google Search 中的收录、也不是排名信号——它管的是 Gemini 应用与 Vertex AI 的训练与 grounding。
两者都在我们的检测表里,且分层不同:Googlebot 属检索型,封禁判失败;Google-Extended 封禁判警告。
这份 robots.txt,哪几行其实不是你写的
检测同时会识别 CDN 注入的托管规则块。一部分 CDN 会在站长不知情的情况下,向 robots.txt 注入整段针对 AI 爬虫的封禁规则。
这一项恒为参考项,既不加分也不扣分。它存在的唯一意义是让上面那些判定能被正确归因:你看到「ClaudeBot 被禁」时,首先该知道的是这行到底是不是你写的——否则你会去改一个你根本没写过的东西。