免费 · 无需注册 · 从海外节点检测

AI 爬虫准入检测六个 AI 平台的爬虫,进得来你的网站吗?

读取你的 robots.txt,逐个判定 ChatGPT、Claude、Perplexity、Gemini、Microsoft Copilot、Google AI 概览背后的爬虫是否被放行。按三层分别判定:训练型、检索型、用户触发型——这三者被封禁的后果完全不同,混在一起看会得出相反的结论。

这里查的是能不能抓到你不查你的品牌在 AI 答案里被提及多少次——那是持续监测做的事。 看持续监测

先选择你的业务类型,报告会换成对应的买家视角

不注册、不留邮箱、不留手机号。检测结果生成一条永久链接,可分享。

封禁 GPTBot,并不会让你从 ChatGPT 的答案里消失

这是这项检测里最常被弄反的一条。OpenAI、Anthropic、Perplexity 三家都把爬虫分成三层,各层用途不同:

训练型(GPTBot、ClaudeBot、CCBot、Amazonbot、Applebot-Extended)只采集训练语料。封禁它们是一个版权决定,与你能不能被引用无关——所以我们不给这一层计分,只如实呈现状态。

检索型(OAI-SearchBot、Claude-SearchBot、PerplexityBot、Bingbot、Googlebot)为搜索回答建索引。封禁其中任何一个,等于在那家 AI 的答案里直接消失——这一层封禁一律判定为失败。

用户触发型(ChatGPT-User、Claude-User、Perplexity-User)只在用户提问时实时抓取。封禁只影响那一次对话,判定为警告。

把三者混为一谈,是目前大量 GEO 文章共同的错误。一份把「GPTBot 被封」写成「你在 ChatGPT 里不可见」的报告,会让你去改一件根本不影响结果的事。

管 Google AI 概览的是 Googlebot,不是 Google-Extended

Google 这一家最容易认错门。直觉会以为带 Extended 的那个负责 AI,但官方文档说的正相反。

Google 在《AI Features and Your Website》里写:AI 已内建于 Search、是 Search 运作方式的一部分,因此 robots.txt 中对 Googlebot 的指令,就是站长用来管理「站点如何为 Search 被抓取」的控制项。AI 概览与 AI Mode 依赖 Search 索引,所以封禁 Googlebot 等于同时退出 AI 概览。

而 Google-Extended,官方明确写着它不影响站点在 Google Search 中的收录、也不是排名信号——它管的是 Gemini 应用与 Vertex AI 的训练与 grounding。

两者都在我们的检测表里,且分层不同:Googlebot 属检索型,封禁判失败;Google-Extended 封禁判警告。

这份 robots.txt,哪几行其实不是你写的

检测同时会识别 CDN 注入的托管规则块。一部分 CDN 会在站长不知情的情况下,向 robots.txt 注入整段针对 AI 爬虫的封禁规则。

这一项恒为参考项,既不加分也不扣分。它存在的唯一意义是让上面那些判定能被正确归因:你看到「ClaudeBot 被禁」时,首先该知道的是这行到底是不是你写的——否则你会去改一个你根本没写过的东西。

常见问题

检测一共覆盖哪些爬虫?

十五个,全部是海外 AI 平台与搜索引擎的爬虫,按训练型、检索型、用户触发型三层归类。每一条的分层都有官方文档依据,判定逻辑随检测引擎一起以 AGPL-3.0 开源,可以逐条核对。

为什么封禁训练型爬虫不扣分?

因为它与「能不能被引用」无关。是否允许自己的内容进入模型训练语料,是一个版权与商业判断,不同企业的答案本来就不一样。把它算成扣分项,等于替你做了一个不属于技术范畴的决定。

检测国内 AI 平台的爬虫吗?

目前不检测。这一版只覆盖海外平台的爬虫,表里没有的爬虫我们不猜、也不列。

报告会给一个总分吗?

不会。不同检测项的重要性差异很大,压进一个分数之后,这个分数本身就不能指导任何行动。我们逐条给结论、证据与边界。

这和你们的付费监测是什么关系?

这一页查的是基础层:爬虫能不能进来。付费的持续监测查的是结果层:你的品牌在六个 AI 平台的答案里到底有没有出现。前者是后者的前提,但两者测的不是同一件事。

判定逻辑完全开源。本页背后的检测引擎以 GNU AGPL-3.0 发布,每一条结论怎么得出、边界在哪里都写在代码与注释里,可逐行核对: github.com/Saqierma/miaowageo