返回技术文章
AI可见度网站检测建站问题GEO实测

155 个网站来测了 AI 可见度:一个月后,三成零不合格,一半以上仍卡在 AI 读不懂的地方

免费检测工具上线满一个月,155 个网站跑了 162 次检测。三成的站一项不合格都没有;但 53% 的站可访问性树不合格,51% 配置了 AI 搜索不用的 llms.txt,12% 对 AI 爬虫返回的内容和浏览器不一样。本文公开第二期全部聚合口径、与首期的逐项对照、6 个站复测的结果,以及这个工具查什么、不查什么。

妙蛙 GEO 研究团队14 分钟

先交代数据从哪来。 2026 年 8 月 7 日到 9 月 8 日,155 个不同的网站在我们的免费 AI 可见度检测工具上跑了 162 次检测。这是第二期聚合分析;第一期截至 8 月 24 日,覆盖 86 个网站。

三条口径不变。第一,全文只有聚合数字,不出现任何被检测网站的域名或可识别信息——检测是站长自己提交的,数据只用于聚合研究。第二,每个百分比都带分母:检测分浅检、深检、探针三个阶段,各阶段成功取得结果的网站数不同,没取到的记「未取得」,不进分母。第三,这是自选样本——来测的人已经在关心 AI 可见度,比例不能外推成「全网如此」;但反过来,连关心的人都普遍栽的坑,大概率是行业级的。

一、一个月过去,榜单变了多少

首期 86 站与第二期 155 站的逐项对照:可访问性树不合格 64% 降到 53%,llms.txt 配置率 46% 升到 51%,无 JSON-LD 40% 到 38%,OG 缺失 44% 到 37%,canonical 问题 37% 到 33%,H1 问题 31% 到 28%,sitemap 问题 26% 到 21%,关闭 JS 无正文 16% 到 13%,AI 爬虫 UA 被拦 12.5% 到 12%
首期 86 站与第二期 155 站的逐项对照:可访问性树不合格 64% 降到 53%,llms.txt 配置率 46% 升到 51%,无 JSON-LD 40% 到 38%,OG 缺失 44% 到 37%,canonical 问题 37% 到 33%,H1 问题 31% 到 28%,sitemap 问题 26% 到 21%,关闭 JS 无正文 16% 到 13%,AI 爬虫 UA 被拦 12.5% 到 12%
检查项首期(截至 08-24,86 站)第二期(截至 09-08,155 站)
可访问性树不合格64%(深检 72 站中 46)53%(125 站中 66)
已配置 llms.txt46%(取到内容的 69 站中 32)51%(126 站中 64)
没有 JSON-LD 结构化数据40%(68 站中 27)38%(127 站中 48)
OG 标签缺失44%(64 站中 28)37%(123 站中 46)
canonical 缺失或错误37%(68 站中 25)33%(127 站中 42)
H1 缺失或多个31%(64 站中 20)28%(123 站中 35)
sitemap 缺失或格式错误26%(65 站中 17)21%(116 站中 24)
关闭 JavaScript 后无正文16%(68 站中 11)13%(127 站中 17)
对 AI 爬虫与浏览器返回不同内容12.5%(48 站中 6)12%(101 站中 12)

两件事值得说。

第一,排序几乎没动。 样本翻了近一倍,可访问性树仍是失败率最高的一项,llms.txt 的配置率反而还在涨。「在 AI 不看的东西上花功夫、在 AI 真正读的地方不设防」这个反差,不是首期的偶然。Google 已明确 Search 不使用 llms.txt,我们的结果页也一直写着不建议为搜索可见性配置它——但它有教程、五分钟能配完,所以配的人越来越多。

第二,多数比例小幅下降。 这有两种解释:后来的站本身质量更高,或者首期文章的读者修了再来测。数据分不清这两种,我们不替它下结论。可访问性树从 64% 降到 53% 这 11 个点,是本期最大的变化,但第二期样本包含第一期,不是同一批站的前后对照。

二、三分之一的站零不合格,四分之一的站背了三分之二的问题

深检完成的 149 个站按不合格项数分布:0 项 47 个(32%),1 项 31 个,2 项 12 个,3 项 13 个,4 项 10 个,5 项及以上 36 个(24%);这 36 个站占全部 383 项不合格中的 249 项,即 65%
深检完成的 149 个站按不合格项数分布:0 项 47 个(32%),1 项 31 个,2 项 12 个,3 项 13 个,4 项 10 个,5 项及以上 36 个(24%);这 36 个站占全部 383 项不合格中的 249 项,即 65%

深检完成的 149 个站里,47 个站(32%)一项不合格都没有。这不是一个高门槛:计分项二十多条,多数是建站系统装好 SEO 插件、模板写规范之后就自动满足的基础项。它说明基础项做全的站真实存在,而且不是零星个例。

另一头,36 个站(24%)有 5 项及以上不合格,这 36 个站占了全部不合格项的 65%(383 项中的 249 项)。中位数是 1 项。问题不是均匀分布的:大部分站只差一两项,少数站几乎每层都有洞。后者往往是同一个模板或同一家建站服务的产物——一个问题背后是一整套页面,修一处等于修全站,反过来漏一处也是全站漏。

三、问题榜第二期:仍按「读不到 → 读不懂 → 不确定」三层看

第二期问题榜三层框架:读不到层——关闭 JS 无正文 13%(127 站)、AI 爬虫 UA 被拦 12%(101 站)、位于 WAF/CDN 之后 46%(123 站);读不懂层——可访问性树不合格 53%(125 站)、无 JSON-LD 38%(127 站)、H1 问题 28%(123 站)、lang 缺失或错误 18%(123 站);不确定层——OG 缺失 37%、canonical 问题 33%、sitemap 问题 21%、description 有问题 67%、hreflang 告警 67%;新增慢层——PageSpeed 性能分未通过 79%(129 站,含告警)
第二期问题榜三层框架:读不到层——关闭 JS 无正文 13%(127 站)、AI 爬虫 UA 被拦 12%(101 站)、位于 WAF/CDN 之后 46%(123 站);读不懂层——可访问性树不合格 53%(125 站)、无 JSON-LD 38%(127 站)、H1 问题 28%(123 站)、lang 缺失或错误 18%(123 站);不确定层——OG 缺失 37%、canonical 问题 33%、sitemap 问题 21%、description 有问题 67%、hreflang 告警 67%;新增慢层——PageSpeed 性能分未通过 79%(129 站,含告警)

第一层:AI 根本读不到

13% 的网站关掉 JavaScript 后没有正文(127 站中 17 个 fail)。多数 AI 爬虫不执行脚本,这些站对它们是空壳。怎么验收、怎么修,见《AI 爬虫不执行 JavaScript:静态 HTML 可读性的技术验收清单》

12% 的网站对 AI 爬虫返回的内容与浏览器不同(探针取得基线的 101 站中 12 个)。探针用浏览器、curl、Googlebot、OAI-SearchBot、GPTBot、ClaudeBot、PerplexityBot 七种身份访问同一页面做差分,这 12 个站里 AI 爬虫拿到的是拦截页、验证页或空响应。

46% 的站位于 WAF/CDN 之后(123 站中 57 个)。其中 Cloudflare 44 个,占识别出来的 77%;阿里云 9 个(其中 4 个只靠 Tengine 特征识别,属弱证据);Fastly、腾讯云各 2 个。这些服务的默认规则正在收紧对 AI 爬虫的处理,Cloudflare 9 月 15 日生效的新默认策略见《AI 爬虫治理实战:Cloudflare 9 月 15 日新默认规则生效前,出海企业必须做的 7 件事》

第二层:AI 读到了,但读不懂

53% 可访问性树不合格(深检 125 站中 66 个)——仍是最高。可访问性树是浏览器从页面算出的语义结构,也是 AI agent 读页面时的主要数据模型;它是什么、什么会把它弄坏、怎么验收,见《可访问性树是 AI agent 读网页的真实视图:语义化 HTML 的工程验收》

38% 没有任何 JSON-LD(127 站中 48 个)。结构化数据的作用边界我们写过,见《Schema 结构化数据在 GEO 里还有用吗?2026 年的实测结论》;但对搜索侧实体识别,它仍是成本最低的机器可读通道。

28% 的 H1 缺失或多个(123 站中 35 个)。

18% 的 `<html lang>` 缺失或错误(123 站中 22 个)——本期新列出。lang 错了,多语言站的每个版本都会被当成同一种语言处理。

第三层:AI 读懂了,但不确定该信哪个版本

37% 缺失 OG 标签(123 站中 46 个)、33% 的 canonical 缺失或指向错误(127 站中 42 个)、21% 的 sitemap 缺失或格式错误(116 站中 24 个)。

65% 的 title 有告警(123 站中 80 个,多为过长、过短或全站雷同)、67% 的 description 有问题(123 站中 fail 加 warn 83 个)。这些是页面的「自我介绍」,缺了它们,引用你的一方只能自己猜摘要。

67% 的 hreflang 有告警(123 站中 82 个)。单语言站影响有限;做多语言的出海站必须处理,规则见《外贸多语言站技术验收:hreflang、canonical、x-default 与 Sitemap 如何不打架》

本期新增的一层:慢

PageSpeed Insights 性能分只有 21% 通过(129 站中 27 个),60% 告警(78 个),19% 不合格(24 个)。真实用户数据(CrUX)只有 30 个站取得——多数被测站的访问量还没有进入 Chrome 的真实用户样本,这本身也是一条信息。性能不是 AI 引用的直接条件,但抓取器有超时,慢到一定程度就回到第一层:读不到。

四、门还是开的,守门的换成了防火墙

robots.txt 明确拦 AI 爬虫的站仍是个例:PerplexityBot 被拦 7 个(138 站中)、OAI-SearchBot 6 个、ClaudeBot 8 个(记分的 51 站中)。绝大多数站长没有主动拦 AI。

真正在替站长做决定的是边缘设施。46% 的站在 WAF/CDN 之后,12% 的站探针实测 AI 爬虫被拦——两个数字之间的差距,就是「装了 Cloudflare 但从没看过它的爬虫规则」的那批站。这一层最容易漏查,因为站长在自己的浏览器里永远看不到那张拦截页。

五、6 个站回来复测了

一个月里 6 个站测了不止一次(5 个两次、1 个三次),两次检测的间隔中位数约 17 天。结果:3 个站的不合格项减少,2 个持平,1 个增加;6 个站合计不合格项从 13 降到 10,修掉的分别是可访问性树、H1 和 JSON-LD 各一项。

六个站不构成任何统计结论。写出来只为一件事:这个工具的用法不是「测一次看个分」,而是修完回来复测。每条结论都带证据和边界,改没改对,一测就知道。

六、这个工具查什么、不查什么

免费检测的三个阶段:浅检约半分钟(robots 准入、canonical、sitemap、元数据、静态可读性、JSON-LD、llms.txt 等参考项);深检几分钟(可访问性树、CLS、PageSpeed 性能、CrUX 真实用户数据);探针与深检并行(七种身份 UA 差分、WAF/CDN 指纹、Content-Signal、边缘 AI 策略);五个设计决定:海外节点、不给综合评分、边界写在结论下、永久链接不注册、判定逻辑开源
免费检测的三个阶段:浅检约半分钟(robots 准入、canonical、sitemap、元数据、静态可读性、JSON-LD、llms.txt 等参考项);深检几分钟(可访问性树、CLS、PageSpeed 性能、CrUX 真实用户数据);探针与深检并行(七种身份 UA 差分、WAF/CDN 指纹、Content-Signal、边缘 AI 策略);五个设计决定:海外节点、不给综合评分、边界写在结论下、永久链接不注册、判定逻辑开源

三个阶段。 浅检约半分钟出结果:robots 对各 AI 爬虫的准入、canonical、noindex、sitemap,title、description、H1、lang、viewport、OG 与图片 alt,关闭脚本后的静态可读性,JSON-LD 与 sameAs,以及 llms.txt、agents.md、UCP 三个不计分的参考项。深检在后台跑几分钟:可访问性树、CLS、PageSpeed 性能分与 CrUX 真实用户数据。探针与深检并行:七种身份访问同一页面做差分,识别 WAF/CDN 厂商,读 Content-Signal 与边缘 AI 策略。

五个设计决定。 从海外节点检测,因为从中国大陆测海外站,延迟、TLS 握手与 CDN 边缘节点全都不同;不给综合评分,综合分会把必要条件、结果与推测混进一个数字,我们只按分组给通过率;每条结论下面写边界,「没测到」与「不合格」分开记,本期各项「未取得」的主因就是对方站点 HTTP 错误、网络与超时,工具不重试以免加重对方负担;结果是一条永久链接,不注册、不留邮箱和手机号;判定逻辑以 GNU AGPL-3.0 开源,每一条怎么得出都能逐行核对。

选择业务类型(外贸制造企业或跨境电商公司)后,报告会换成对应买家的视角解释,并生成 5 道海外买家可能会问的问题预览。这 5 道题没有被提交到任何 AI 平台,不是可见度结果。

它不查的。 内容质量、品牌是否被 AI 提及或推荐、引用概率。技术上能被读取,不等于已经被推荐——被收录和被引用是两条链路。要知道「AI 现在怎么回答关于你的问题」,得在真实平台上持续提问并留证据,那是付费监测做的事:ChatGPT 单平台版每月 99 元,跨平台版每月 699 元,每 72 小时一轮、每个平台 50 题,回答原文、时间、来源与截图都保留。免费与付费的边界画在这里:前者回答「能不能被读到」,后者回答「被读到之后发生了什么」。

七、三步,十分钟

  1. 打开检测页,输入官网首页地址——自有域名,不是阿里国际站这类平台店铺页——半分钟后先看浅检。
  2. 等几分钟看深检与探针。先看「读不到」那一层:那层有不合格,别的先不用管。
  3. 把结果页的永久链接发给建站方,按每条结论下面的「怎么修」处理;修完回来复测,看那一条有没有从不合格变成通过。

边界声明

  • 样本为 2026 年 8 月 7 日至 9 月 8 日主动使用检测工具的 155 个网站,自选样本,各项比例不外推至全网。
  • 各项分母不同(浅检 116 到 138、深检 125 到 129、探针 101 到 123),因各阶段成功取得结果的站点数不同;「未取得」不计入分母。
  • 与首期的对照是两个时间点、两个样本(第二期包含第一期),不是同一批站的前后对照;比例下降不能解释为「修好了」。
  • 可访问性树是二元判定;性能分是 PageSpeed 实验室数据;复测 6 站不构成统计结论。
  • 检测结果反映被测时点的状态,网站随时可能变更配置;单项判定标准以结果页逐项说明与开源代码为准。
  • 本文不点名任何被检测网站,聚合数字无法反推个体;不承诺收录、固定排名、流量或收入。

关于我们: 妙蛙 GEO(Miaowa GEO)是天津思必得科技有限公司旗下的生成式引擎优化(GEO)产品,2026 年成立,统一社会信用代码 91120223MAKH9RTU1Q,网站备案号津ICP备2026010121号,服务外贸企业、跨境电商与出海品牌方。我们不代表任何第三方 AI 平台,也不承诺收录、固定排名、流量或收入。

本文数据来源:妙蛙 GEO 免费检测工具(miaowageo.com/geocheck)2026 年 8 月 7 日至 9 月 8 日的检测记录聚合,仅使用聚合统计,不涉及任何单站可识别信息;性能与真实用户数据来自 Google PageSpeed Insights 与 Chrome UX Report。

本文由妙蛙 GEO 研究团队撰写,使用 AI 辅助进行资料整理与语言校对,文中事实、来源和结论均经人工复核。

继续阅读

相关技术文章

AI可见度86 个网站来测了 AI 可见度:近一半在配置 AI 不看的东西,三分之二栽在 AI 真正读的地方

86 个网站在我们的免费检测工具上跑了 99 次 AI 可见度检测。聚合数据里最扎眼的不是某一项失败率,而是一个反差:46% 的网站配置了对 AI 搜索没用的 llms.txt,同时 64% 的网站栽在 AI agent 真正用来读页面的可访问性树上。本文公开全部聚合口径:AI 读不到、读不懂、不确定三层问题的逐项分布与修法。

AI可见度新站可见性实测:从「零结果」到品牌词第一,中间的三天发生了什么

2026 年 8 月 7 日,我们在 Bing 上搜自己的品牌名,返回的是汉字字典页。8 月 10 日,同一个查询里官网排第一。这篇记录完整的观测方法、干预动作和限制条件——包括我们无法证明的部分。

AI可见度这一周,AI 可见度的三个测量口径同时出了问题(含我们自己证据链的一个洞)

点击层漏掉了引用率最高的那批页面,答案层的单平台采样被证明不成立,报表层连 Google 官方的生成式 AI 报告都出了 bug。这三件事发生在同一周,其中第一件直接命中我们自己发布过的四层证据链方法论。本文公开这个缺口,并给出修订后的口径。