结论先讲:AI 可见度自查分三层——能不能被抓到(技术层)、有没有被提到(曝光层)、说得对不对(准确性层)。绝大多数企业的问题卡在第一层,而且是自己造成的:有第三方审计称约 73% 的网站存在阻挡 AI 爬虫的技术障碍。这份清单不需要任何付费工具,一个下午可以做完,做完你会得到一份可以逐月复测的基线。
先说明一件事:这份清单的价值不在于"发现问题",而在于建立基线。没有基线,你之后所有的优化都无法证明有效。
第一层:技术可达性(第 1–5 项)
这一层是零和的——不通过,后面全部无意义。Google 官方也明确要求:页面必须被索引且有资格展示摘要,才有机会出现在生成式功能中。
✅ 1. robots.txt 是否屏蔽了 AI 爬虫
怎么做:浏览器打开 你的域名/robots.txt,查找以下 User-agent:
| 爬虫 | 归属 | 作用 |
|---|---|---|
GPTBot | OpenAI | 训练数据抓取 |
OAI-SearchBot | OpenAI | ChatGPT 搜索索引 |
ChatGPT-User | OpenAI | 用户触发的实时访问 |
PerplexityBot | Perplexity | 索引抓取 |
Perplexity-User | Perplexity | 用户触发的实时访问 |
ClaudeBot / Claude-SearchBot | Anthropic | 抓取与搜索 |
Google-Extended | Gemini 训练与 grounding | |
Bytespider | 字节跳动 | 豆包生态 |
Amazonbot | Amazon | Rufus 等 |
Applebot-Extended | Apple | Apple Intelligence |
判定标准:出现任何 Disallow: / 针对上述 UA 的规则即为不通过。
特别注意 `Google-Extended`:屏蔽它会影响你在 Gemini 相关体验中的出现,但不影响 Google 传统搜索排名。很多站在 2024 年出于版权顾虑屏蔽了它,之后忘记了。这是最常见的自伤。
决策提示:允许训练抓取(GPTBot)和允许搜索抓取(OAI-SearchBot)是两个独立决定。如果你担心内容被用于训练但希望被引用,可以只放开后者。
✅ 2. CDN / WAF 是否在网络层拦截
这一项比 robots.txt 更隐蔽,也更常见。 robots.txt 写得再开放,如果 Cloudflare 的 Bot Fight Mode、阿里云 WAF 或安全狗在网络层返回 403,爬虫根本读不到你的页面。
怎么做:
curl -A "OAI-SearchBot/1.0" -I https://你的域名/
curl -A "PerplexityBot/1.0" -I https://你的域名/
curl -A "ClaudeBot/1.0" -I https://你的域名/判定标准:必须返回 200。返回 403、503、或跳转到验证页面即为不通过。
修复:在 CDN 控制台的 Bot 管理中,将上述 UA 加入白名单。Cloudflare 已提供 AI 爬虫的分类管理选项。
✅ 3. 核心内容是否依赖 JavaScript 渲染
多数 AI 爬虫的 JS 渲染能力弱于 Googlebot,有些完全不执行 JS。
怎么做:浏览器禁用 JavaScript 后刷新首页和一个产品页;或直接 curl https://你的域名/ | grep "你的核心产品名"。
判定标准:产品名称、参数、公司介绍、联系方式必须出现在原始 HTML 中。
修复:SSR / SSG / 预渲染。这是纯前端 SPA 站点最大的 GEO 短板。
✅ 4. 页面是否可被索引且有摘要资格
怎么做:检查是否存在 <meta name="robots" content="noindex"> 或 nosnippet、max-snippet:0;在 Search Console 用网址检查工具确认收录状态。
判定标准:核心页面全部已编入索引,无 noindex / nosnippet。
补充:Google 要求网站在 Search Console 中被包含在生成式 AI 功能范围内才有展示资格,这一项也需要确认。
✅ 5. 站点速度与可用性
怎么做:PageSpeed Insights 跑首页 + 一个内页;检查服务器对海外访问的响应(外贸站尤其重要,很多国内主机对海外爬虫响应极慢或超时)。
判定标准:无频繁 5xx;海外 TTFB 在可接受范围内。
外贸站特别提示:如果你的服务器在国内且没有海外 CDN,OpenAI 和 Perplexity 的爬虫(IP 在海外)访问体验可能极差。这是一个被普遍忽略的问题。
第二层:曝光基线(第 6–10 项)
这一层不是"检查有没有问题",而是测量当前状态并存档。这是整份清单里最有长期价值的部分。
✅ 6. 建立你的问题集(30–50 个)
这一项做不好,后面全废。 问题必须是你的真实客户会问的,不是你希望他们问的。
三类问题各占三分之一:
| 类型 | 示例(外贸机械) | 测什么 |
|---|---|---|
| 品牌类 | "介绍一下 XX 公司" | 认知准确性 |
| 品类类 | "中国有哪些可靠的 CNC 加工设备供应商" | 推荐位争夺 |
| 问题类 | "选择注塑机时应该关注哪些参数" | 内容被引用 |
获取真实问题的方法:翻你的询盘记录、客服记录、销售常被问到的问题。不要凭空想。
✅ 7. 跨平台测试并记录
怎么做:把问题集在以下平台各跑一遍,用无痕/未登录状态(避免个性化污染):
- 海外市场:ChatGPT(含搜索)、Perplexity、Google AI Overviews、Gemini、Claude
- 国内市场:DeepSeek、豆包、元宝、夸克、秘塔、百度 AI 搜索
记录四个字段(建议直接建一张表):
| 问题 | 平台 | 是否提及本品牌 | 提及位置(第几个) | 引用来源域名 |
判定标准:这一项没有及格线,它就是你的基线。存档,标注日期。
✅ 8. 记录竞争对手的表现
用同一批问题,记录被提到的所有竞品名称和频次。
判定标准:如果某个竞品在品类类问题中出现频率远高于你,把它被引用的来源域名列出来——这是最直接的可复制路径。
✅ 9. 检查提及的语境是正面还是负面
不要只统计"有没有被提到"。AI 说"XX 公司是华东地区领先的精密加工厂"和"XX 公司曾有客户投诉交期问题",都算被提及,但价值相反。
判定标准:记录每次提及的语境倾向。负面提及需要单独处理。
✅ 10. 记录 AI 引用了哪些来源
这是第 7 项里最有信息量的字段,值得单独强调。
判定标准:统计出现频次最高的 10 个来源域名。这份名单直接告诉你站外资源应该投在哪里——不是靠猜,是靠观察。
第三层:准确性与实体(第 11–15 项)
被提到但说错了,比不被提到更危险。
✅ 11. 公司基本信息是否被正确描述
在各平台问"XX 公司是做什么的""XX 公司在哪里""XX 公司成立于哪一年"。
判定标准:主营业务、所在地、成立时间、规模四项须准确。
常见错误:与同名公司混淆、业务描述停留在几年前、把子公司或代理商信息算到你头上。
✅ 12. 是否存在实体混淆
怎么做:搜索与你公司名相近的其他企业,测试 AI 能否区分。
修复:这正是 Organization schema 的 sameAs 字段要解决的问题——把官网、LinkedIn、行业档案、B2B 平台店铺页显式绑定为同一实体。
✅ 13. 跨平台信息一致性
怎么做:列出你的官网、LinkedIn、阿里国际站/中国制造网、公众号、企业信用信息公示系统上的公司名称(中英文)、成立时间、地址、主营业务描述。
判定标准:全部一致。不一致的地方就是 AI 产生错误描述的源头。
这一项修复成本最低、收益最直接,但几乎所有企业都存在不一致。
✅ 14. 是否存在过期或负面信息在前排
怎么做:在各平台问"XX 公司有什么问题吗""XX 公司的负面评价"。
判定标准:记录 AI 引用的负面来源。如果是事实性错误,可通过原平台的更正机制处理;如果是真实的历史问题,需要用新的、更权威的正面内容稀释——而不是试图删除。
✅ 15. 官网是否有可被引用的"事实页"
AI 在回答关于你的事实性问题时,需要一个权威、结构清晰的来源。
判定标准:官网应有一个信息完整的"关于我们"页,包含:法定全称与常用简称、成立时间、地址、主营业务、核心能力/产能、资质认证、联系方式。这些信息要以纯文本形式出现(不是图片,不是 PDF),并加上 Organization schema。
这是投入产出比最高的单页优化。 大多数企业的"关于我们"页是一篇没有任何具体数字的抒情散文,对 AI 完全无用。
自查结果怎么用
做完 15 项,你手上会有三样东西:
- 一份技术问题清单(第 1–5 项的不通过项)——这些应该在两周内修完,成本低、见效确定。
- 一份曝光基线表(第 6–10 项)——这是你未来所有优化的对照组。请标注日期并原样保存,不要覆盖。
- 一份事实修正清单(第 11–15 项)——这些通常一个月内可以修完。
复测节奏建议:技术层每季度一次,曝光层每月一次(用完全相同的问题集),准确性层每季度一次。
一个重要提醒:单次复测的变化很可能来自平台自身调整而非你的动作。有记录显示,某平台的信源份额曾在两周内出现数倍变化。至少积累三个数据点再下结论。
常见问题
Q:不用工具真的能做吗? 能。这份清单的全部内容都可以手工完成,成本是半天到一天。付费工具的价值在于自动化和规模化复测——当你的问题集超过 100 个、需要每周跑一次时,手工不可持续。但第一次基线,手工做反而更好,因为你会真正看到 AI 是怎么回答的。
Q:问题集应该多大? 起步 30–50 个足够。关键是每次复测用完全相同的问题集,否则数据不可比。
Q:为什么要用未登录状态测试? AI 平台会根据历史对话做个性化。用你自己的常用账号测,看到的可能是被你自己的搜索历史污染过的结果。
Q:发现被屏蔽的爬虫,应该全部放开吗? 这是商业决策不是技术决策。放开训练类爬虫意味着内容可能被用于模型训练;只放开搜索类爬虫可以在保留内容的同时获得引用机会。建议区分对待。
Q:多久能看到改善? 技术层修复后,索引更新通常 2–6 周。内容和实体层的改善,观察窗口建议 8 周以上。
Q:这份清单适用于国内平台吗? 第 1–5 项的原理通用,但爬虫 UA 需要替换为国内平台对应的标识;第 6–15 项完全通用,只需要把测试平台换成国内的。
本文提及的第三方数据:Otterly AI 关于 73% 网站存在 AI 爬虫访问障碍的统计(100 万+ 次引用分析,2026 年 1–2 月);平台信源份额波动记录来自 5W Citation Source Audit Q1 2026。技术要求依据 Google Search Central 生成式 AI 优化官方指南(2026-05-15)。本文最后核查日期:2026 年 7 月 31 日。
作者:妙蛙 GEO 研究团队 | 如果你希望把这份自查升级为持续监测的多平台可见度报告,可以联系我们。
