返回技术文章
AI 可见度GEO 审计品牌监测检查清单

如何自查 AI 可见度?一份免费的 15 项审计清单

不用买工具,一个下午就能完成的 AI 可见度自查。含爬虫可达性检测、跨平台品牌提及基线建立、事实准确性核查的具体操作步骤与判定标准。

妙蛙 GEO 研究团队11 分钟

结论先讲:AI 可见度自查分三层——能不能被抓到(技术层)、有没有被提到(曝光层)、说得对不对(准确性层)。绝大多数企业的问题卡在第一层,而且是自己造成的:有第三方审计称约 73% 的网站存在阻挡 AI 爬虫的技术障碍。这份清单不需要任何付费工具,一个下午可以做完,做完你会得到一份可以逐月复测的基线。

先说明一件事:这份清单的价值不在于"发现问题",而在于建立基线。没有基线,你之后所有的优化都无法证明有效。


第一层:技术可达性(第 1–5 项)

这一层是零和的——不通过,后面全部无意义。Google 官方也明确要求:页面必须被索引且有资格展示摘要,才有机会出现在生成式功能中。

✅ 1. robots.txt 是否屏蔽了 AI 爬虫

怎么做:浏览器打开 你的域名/robots.txt,查找以下 User-agent:

爬虫归属作用
GPTBotOpenAI训练数据抓取
OAI-SearchBotOpenAIChatGPT 搜索索引
ChatGPT-UserOpenAI用户触发的实时访问
PerplexityBotPerplexity索引抓取
Perplexity-UserPerplexity用户触发的实时访问
ClaudeBot / Claude-SearchBotAnthropic抓取与搜索
Google-ExtendedGoogleGemini 训练与 grounding
Bytespider字节跳动豆包生态
AmazonbotAmazonRufus 等
Applebot-ExtendedAppleApple Intelligence

判定标准:出现任何 Disallow: / 针对上述 UA 的规则即为不通过。

特别注意 `Google-Extended`:屏蔽它会影响你在 Gemini 相关体验中的出现,但不影响 Google 传统搜索排名。很多站在 2024 年出于版权顾虑屏蔽了它,之后忘记了。这是最常见的自伤。

决策提示:允许训练抓取(GPTBot)和允许搜索抓取(OAI-SearchBot)是两个独立决定。如果你担心内容被用于训练但希望被引用,可以只放开后者。

✅ 2. CDN / WAF 是否在网络层拦截

这一项比 robots.txt 更隐蔽,也更常见。 robots.txt 写得再开放,如果 Cloudflare 的 Bot Fight Mode、阿里云 WAF 或安全狗在网络层返回 403,爬虫根本读不到你的页面。

怎么做

curl -A "OAI-SearchBot/1.0" -I https://你的域名/
curl -A "PerplexityBot/1.0" -I https://你的域名/
curl -A "ClaudeBot/1.0" -I https://你的域名/

判定标准:必须返回 200。返回 403503、或跳转到验证页面即为不通过。

修复:在 CDN 控制台的 Bot 管理中,将上述 UA 加入白名单。Cloudflare 已提供 AI 爬虫的分类管理选项。

✅ 3. 核心内容是否依赖 JavaScript 渲染

多数 AI 爬虫的 JS 渲染能力弱于 Googlebot,有些完全不执行 JS。

怎么做:浏览器禁用 JavaScript 后刷新首页和一个产品页;或直接 curl https://你的域名/ | grep "你的核心产品名"

判定标准:产品名称、参数、公司介绍、联系方式必须出现在原始 HTML 中。

修复:SSR / SSG / 预渲染。这是纯前端 SPA 站点最大的 GEO 短板。

✅ 4. 页面是否可被索引且有摘要资格

怎么做:检查是否存在 <meta name="robots" content="noindex">nosnippetmax-snippet:0;在 Search Console 用网址检查工具确认收录状态。

判定标准:核心页面全部已编入索引,无 noindex / nosnippet。

补充:Google 要求网站在 Search Console 中被包含在生成式 AI 功能范围内才有展示资格,这一项也需要确认。

✅ 5. 站点速度与可用性

怎么做:PageSpeed Insights 跑首页 + 一个内页;检查服务器对海外访问的响应(外贸站尤其重要,很多国内主机对海外爬虫响应极慢或超时)。

判定标准:无频繁 5xx;海外 TTFB 在可接受范围内。

外贸站特别提示:如果你的服务器在国内且没有海外 CDN,OpenAI 和 Perplexity 的爬虫(IP 在海外)访问体验可能极差。这是一个被普遍忽略的问题。


第二层:曝光基线(第 6–10 项)

这一层不是"检查有没有问题",而是测量当前状态并存档。这是整份清单里最有长期价值的部分。

✅ 6. 建立你的问题集(30–50 个)

这一项做不好,后面全废。 问题必须是你的真实客户会问的,不是你希望他们问的。

三类问题各占三分之一:

类型示例(外贸机械)测什么
品牌类"介绍一下 XX 公司"认知准确性
品类类"中国有哪些可靠的 CNC 加工设备供应商"推荐位争夺
问题类"选择注塑机时应该关注哪些参数"内容被引用

获取真实问题的方法:翻你的询盘记录、客服记录、销售常被问到的问题。不要凭空想。

✅ 7. 跨平台测试并记录

怎么做:把问题集在以下平台各跑一遍,用无痕/未登录状态(避免个性化污染):

  • 海外市场:ChatGPT(含搜索)、Perplexity、Google AI Overviews、Gemini、Claude
  • 国内市场:DeepSeek、豆包、元宝、夸克、秘塔、百度 AI 搜索

记录四个字段(建议直接建一张表):

| 问题 | 平台 | 是否提及本品牌 | 提及位置(第几个) | 引用来源域名 |

判定标准:这一项没有及格线,它就是你的基线。存档,标注日期。

✅ 8. 记录竞争对手的表现

用同一批问题,记录被提到的所有竞品名称和频次。

判定标准:如果某个竞品在品类类问题中出现频率远高于你,把它被引用的来源域名列出来——这是最直接的可复制路径。

✅ 9. 检查提及的语境是正面还是负面

不要只统计"有没有被提到"。AI 说"XX 公司是华东地区领先的精密加工厂"和"XX 公司曾有客户投诉交期问题",都算被提及,但价值相反。

判定标准:记录每次提及的语境倾向。负面提及需要单独处理。

✅ 10. 记录 AI 引用了哪些来源

这是第 7 项里最有信息量的字段,值得单独强调。

判定标准:统计出现频次最高的 10 个来源域名。这份名单直接告诉你站外资源应该投在哪里——不是靠猜,是靠观察。


第三层:准确性与实体(第 11–15 项)

被提到但说错了,比不被提到更危险。

✅ 11. 公司基本信息是否被正确描述

在各平台问"XX 公司是做什么的""XX 公司在哪里""XX 公司成立于哪一年"。

判定标准:主营业务、所在地、成立时间、规模四项须准确。

常见错误:与同名公司混淆、业务描述停留在几年前、把子公司或代理商信息算到你头上。

✅ 12. 是否存在实体混淆

怎么做:搜索与你公司名相近的其他企业,测试 AI 能否区分。

修复:这正是 Organization schema 的 sameAs 字段要解决的问题——把官网、LinkedIn、行业档案、B2B 平台店铺页显式绑定为同一实体。

✅ 13. 跨平台信息一致性

怎么做:列出你的官网、LinkedIn、阿里国际站/中国制造网、公众号、企业信用信息公示系统上的公司名称(中英文)、成立时间、地址、主营业务描述。

判定标准:全部一致。不一致的地方就是 AI 产生错误描述的源头。

这一项修复成本最低、收益最直接,但几乎所有企业都存在不一致。

✅ 14. 是否存在过期或负面信息在前排

怎么做:在各平台问"XX 公司有什么问题吗""XX 公司的负面评价"。

判定标准:记录 AI 引用的负面来源。如果是事实性错误,可通过原平台的更正机制处理;如果是真实的历史问题,需要用新的、更权威的正面内容稀释——而不是试图删除。

✅ 15. 官网是否有可被引用的"事实页"

AI 在回答关于你的事实性问题时,需要一个权威、结构清晰的来源。

判定标准:官网应有一个信息完整的"关于我们"页,包含:法定全称与常用简称、成立时间、地址、主营业务、核心能力/产能、资质认证、联系方式。这些信息要以纯文本形式出现(不是图片,不是 PDF),并加上 Organization schema。

这是投入产出比最高的单页优化。 大多数企业的"关于我们"页是一篇没有任何具体数字的抒情散文,对 AI 完全无用。


自查结果怎么用

做完 15 项,你手上会有三样东西:

  1. 一份技术问题清单(第 1–5 项的不通过项)——这些应该在两周内修完,成本低、见效确定。
  2. 一份曝光基线表(第 6–10 项)——这是你未来所有优化的对照组。请标注日期并原样保存,不要覆盖。
  3. 一份事实修正清单(第 11–15 项)——这些通常一个月内可以修完。

复测节奏建议:技术层每季度一次,曝光层每月一次(用完全相同的问题集),准确性层每季度一次。

一个重要提醒:单次复测的变化很可能来自平台自身调整而非你的动作。有记录显示,某平台的信源份额曾在两周内出现数倍变化。至少积累三个数据点再下结论。


常见问题

Q:不用工具真的能做吗? 能。这份清单的全部内容都可以手工完成,成本是半天到一天。付费工具的价值在于自动化和规模化复测——当你的问题集超过 100 个、需要每周跑一次时,手工不可持续。但第一次基线,手工做反而更好,因为你会真正看到 AI 是怎么回答的。

Q:问题集应该多大? 起步 30–50 个足够。关键是每次复测用完全相同的问题集,否则数据不可比。

Q:为什么要用未登录状态测试? AI 平台会根据历史对话做个性化。用你自己的常用账号测,看到的可能是被你自己的搜索历史污染过的结果。

Q:发现被屏蔽的爬虫,应该全部放开吗? 这是商业决策不是技术决策。放开训练类爬虫意味着内容可能被用于模型训练;只放开搜索类爬虫可以在保留内容的同时获得引用机会。建议区分对待。

Q:多久能看到改善? 技术层修复后,索引更新通常 2–6 周。内容和实体层的改善,观察窗口建议 8 周以上。

Q:这份清单适用于国内平台吗? 第 1–5 项的原理通用,但爬虫 UA 需要替换为国内平台对应的标识;第 6–15 项完全通用,只需要把测试平台换成国内的。


本文提及的第三方数据:Otterly AI 关于 73% 网站存在 AI 爬虫访问障碍的统计(100 万+ 次引用分析,2026 年 1–2 月);平台信源份额波动记录来自 5W Citation Source Audit Q1 2026。技术要求依据 Google Search Central 生成式 AI 优化官方指南(2026-05-15)。本文最后核查日期:2026 年 7 月 31 日。

作者:妙蛙 GEO 研究团队 | 如果你希望把这份自查升级为持续监测的多平台可见度报告,可以联系我们。

继续阅读

相关技术文章

AI 可见度AI 可见度是什么?如何量化品牌在 AI 回答中的存在感

AI 可见度(AI Visibility)是指一个品牌、产品或网站在生成式 AI 回答中被提及、引用或推荐的频率与质量的综合度量。

一人公司一人公司出海(OPC)2026:定义、5 种可跑通的模式与真实成本

一人公司出海不等于一人有限责任公司。本文拆解 5 种可运行模式、真实成本、常见失败原因,以及单人创业者在 2026 年需要正视的风险与边界。

RAGAI 的引用决策发生在检索阶段:RAG 六环节完整拆解

AI 的引用决策不发生在生成答案那一刻,而发生在更早的检索阶段。本文拆解 RAG 完整链路的六个环节,说明每一环筛掉了谁,以及企业真正能干预的只有三处。