先交代数据从哪来。 2026 年 8 月 7 日到 9 月 8 日,155 个不同的网站在我们的免费 AI 可见度检测工具上跑了 162 次检测。这是第二期聚合分析;第一期截至 8 月 24 日,覆盖 86 个网站。
三条口径不变。第一,全文只有聚合数字,不出现任何被检测网站的域名或可识别信息——检测是站长自己提交的,数据只用于聚合研究。第二,每个百分比都带分母:检测分浅检、深检、探针三个阶段,各阶段成功取得结果的网站数不同,没取到的记「未取得」,不进分母。第三,这是自选样本——来测的人已经在关心 AI 可见度,比例不能外推成「全网如此」;但反过来,连关心的人都普遍栽的坑,大概率是行业级的。
一、一个月过去,榜单变了多少

| 检查项 | 首期(截至 08-24,86 站) | 第二期(截至 09-08,155 站) |
|---|---|---|
| 可访问性树不合格 | 64%(深检 72 站中 46) | 53%(125 站中 66) |
| 已配置 llms.txt | 46%(取到内容的 69 站中 32) | 51%(126 站中 64) |
| 没有 JSON-LD 结构化数据 | 40%(68 站中 27) | 38%(127 站中 48) |
| OG 标签缺失 | 44%(64 站中 28) | 37%(123 站中 46) |
| canonical 缺失或错误 | 37%(68 站中 25) | 33%(127 站中 42) |
| H1 缺失或多个 | 31%(64 站中 20) | 28%(123 站中 35) |
| sitemap 缺失或格式错误 | 26%(65 站中 17) | 21%(116 站中 24) |
| 关闭 JavaScript 后无正文 | 16%(68 站中 11) | 13%(127 站中 17) |
| 对 AI 爬虫与浏览器返回不同内容 | 12.5%(48 站中 6) | 12%(101 站中 12) |
两件事值得说。
第一,排序几乎没动。 样本翻了近一倍,可访问性树仍是失败率最高的一项,llms.txt 的配置率反而还在涨。「在 AI 不看的东西上花功夫、在 AI 真正读的地方不设防」这个反差,不是首期的偶然。Google 已明确 Search 不使用 llms.txt,我们的结果页也一直写着不建议为搜索可见性配置它——但它有教程、五分钟能配完,所以配的人越来越多。
第二,多数比例小幅下降。 这有两种解释:后来的站本身质量更高,或者首期文章的读者修了再来测。数据分不清这两种,我们不替它下结论。可访问性树从 64% 降到 53% 这 11 个点,是本期最大的变化,但第二期样本包含第一期,不是同一批站的前后对照。
二、三分之一的站零不合格,四分之一的站背了三分之二的问题

深检完成的 149 个站里,47 个站(32%)一项不合格都没有。这不是一个高门槛:计分项二十多条,多数是建站系统装好 SEO 插件、模板写规范之后就自动满足的基础项。它说明基础项做全的站真实存在,而且不是零星个例。
另一头,36 个站(24%)有 5 项及以上不合格,这 36 个站占了全部不合格项的 65%(383 项中的 249 项)。中位数是 1 项。问题不是均匀分布的:大部分站只差一两项,少数站几乎每层都有洞。后者往往是同一个模板或同一家建站服务的产物——一个问题背后是一整套页面,修一处等于修全站,反过来漏一处也是全站漏。
三、问题榜第二期:仍按「读不到 → 读不懂 → 不确定」三层看

第一层:AI 根本读不到
13% 的网站关掉 JavaScript 后没有正文(127 站中 17 个 fail)。多数 AI 爬虫不执行脚本,这些站对它们是空壳。怎么验收、怎么修,见《AI 爬虫不执行 JavaScript:静态 HTML 可读性的技术验收清单》。
12% 的网站对 AI 爬虫返回的内容与浏览器不同(探针取得基线的 101 站中 12 个)。探针用浏览器、curl、Googlebot、OAI-SearchBot、GPTBot、ClaudeBot、PerplexityBot 七种身份访问同一页面做差分,这 12 个站里 AI 爬虫拿到的是拦截页、验证页或空响应。
46% 的站位于 WAF/CDN 之后(123 站中 57 个)。其中 Cloudflare 44 个,占识别出来的 77%;阿里云 9 个(其中 4 个只靠 Tengine 特征识别,属弱证据);Fastly、腾讯云各 2 个。这些服务的默认规则正在收紧对 AI 爬虫的处理,Cloudflare 9 月 15 日生效的新默认策略见《AI 爬虫治理实战:Cloudflare 9 月 15 日新默认规则生效前,出海企业必须做的 7 件事》。
第二层:AI 读到了,但读不懂
53% 可访问性树不合格(深检 125 站中 66 个)——仍是最高。可访问性树是浏览器从页面算出的语义结构,也是 AI agent 读页面时的主要数据模型;它是什么、什么会把它弄坏、怎么验收,见《可访问性树是 AI agent 读网页的真实视图:语义化 HTML 的工程验收》。
38% 没有任何 JSON-LD(127 站中 48 个)。结构化数据的作用边界我们写过,见《Schema 结构化数据在 GEO 里还有用吗?2026 年的实测结论》;但对搜索侧实体识别,它仍是成本最低的机器可读通道。
28% 的 H1 缺失或多个(123 站中 35 个)。
18% 的 `<html lang>` 缺失或错误(123 站中 22 个)——本期新列出。lang 错了,多语言站的每个版本都会被当成同一种语言处理。
第三层:AI 读懂了,但不确定该信哪个版本
37% 缺失 OG 标签(123 站中 46 个)、33% 的 canonical 缺失或指向错误(127 站中 42 个)、21% 的 sitemap 缺失或格式错误(116 站中 24 个)。
65% 的 title 有告警(123 站中 80 个,多为过长、过短或全站雷同)、67% 的 description 有问题(123 站中 fail 加 warn 83 个)。这些是页面的「自我介绍」,缺了它们,引用你的一方只能自己猜摘要。
67% 的 hreflang 有告警(123 站中 82 个)。单语言站影响有限;做多语言的出海站必须处理,规则见《外贸多语言站技术验收:hreflang、canonical、x-default 与 Sitemap 如何不打架》。
本期新增的一层:慢
PageSpeed Insights 性能分只有 21% 通过(129 站中 27 个),60% 告警(78 个),19% 不合格(24 个)。真实用户数据(CrUX)只有 30 个站取得——多数被测站的访问量还没有进入 Chrome 的真实用户样本,这本身也是一条信息。性能不是 AI 引用的直接条件,但抓取器有超时,慢到一定程度就回到第一层:读不到。
四、门还是开的,守门的换成了防火墙
robots.txt 明确拦 AI 爬虫的站仍是个例:PerplexityBot 被拦 7 个(138 站中)、OAI-SearchBot 6 个、ClaudeBot 8 个(记分的 51 站中)。绝大多数站长没有主动拦 AI。
真正在替站长做决定的是边缘设施。46% 的站在 WAF/CDN 之后,12% 的站探针实测 AI 爬虫被拦——两个数字之间的差距,就是「装了 Cloudflare 但从没看过它的爬虫规则」的那批站。这一层最容易漏查,因为站长在自己的浏览器里永远看不到那张拦截页。
五、6 个站回来复测了
一个月里 6 个站测了不止一次(5 个两次、1 个三次),两次检测的间隔中位数约 17 天。结果:3 个站的不合格项减少,2 个持平,1 个增加;6 个站合计不合格项从 13 降到 10,修掉的分别是可访问性树、H1 和 JSON-LD 各一项。
六个站不构成任何统计结论。写出来只为一件事:这个工具的用法不是「测一次看个分」,而是修完回来复测。每条结论都带证据和边界,改没改对,一测就知道。
六、这个工具查什么、不查什么

三个阶段。 浅检约半分钟出结果:robots 对各 AI 爬虫的准入、canonical、noindex、sitemap,title、description、H1、lang、viewport、OG 与图片 alt,关闭脚本后的静态可读性,JSON-LD 与 sameAs,以及 llms.txt、agents.md、UCP 三个不计分的参考项。深检在后台跑几分钟:可访问性树、CLS、PageSpeed 性能分与 CrUX 真实用户数据。探针与深检并行:七种身份访问同一页面做差分,识别 WAF/CDN 厂商,读 Content-Signal 与边缘 AI 策略。
五个设计决定。 从海外节点检测,因为从中国大陆测海外站,延迟、TLS 握手与 CDN 边缘节点全都不同;不给综合评分,综合分会把必要条件、结果与推测混进一个数字,我们只按分组给通过率;每条结论下面写边界,「没测到」与「不合格」分开记,本期各项「未取得」的主因就是对方站点 HTTP 错误、网络与超时,工具不重试以免加重对方负担;结果是一条永久链接,不注册、不留邮箱和手机号;判定逻辑以 GNU AGPL-3.0 开源,每一条怎么得出都能逐行核对。
选择业务类型(外贸制造企业或跨境电商公司)后,报告会换成对应买家的视角解释,并生成 5 道海外买家可能会问的问题预览。这 5 道题没有被提交到任何 AI 平台,不是可见度结果。
它不查的。 内容质量、品牌是否被 AI 提及或推荐、引用概率。技术上能被读取,不等于已经被推荐——被收录和被引用是两条链路。要知道「AI 现在怎么回答关于你的问题」,得在真实平台上持续提问并留证据,那是付费监测做的事:ChatGPT 单平台版每月 99 元,跨平台版每月 699 元,每 72 小时一轮、每个平台 50 题,回答原文、时间、来源与截图都保留。免费与付费的边界画在这里:前者回答「能不能被读到」,后者回答「被读到之后发生了什么」。
七、三步,十分钟
- 打开检测页,输入官网首页地址——自有域名,不是阿里国际站这类平台店铺页——半分钟后先看浅检。
- 等几分钟看深检与探针。先看「读不到」那一层:那层有不合格,别的先不用管。
- 把结果页的永久链接发给建站方,按每条结论下面的「怎么修」处理;修完回来复测,看那一条有没有从不合格变成通过。
边界声明
- 样本为 2026 年 8 月 7 日至 9 月 8 日主动使用检测工具的 155 个网站,自选样本,各项比例不外推至全网。
- 各项分母不同(浅检 116 到 138、深检 125 到 129、探针 101 到 123),因各阶段成功取得结果的站点数不同;「未取得」不计入分母。
- 与首期的对照是两个时间点、两个样本(第二期包含第一期),不是同一批站的前后对照;比例下降不能解释为「修好了」。
- 可访问性树是二元判定;性能分是 PageSpeed 实验室数据;复测 6 站不构成统计结论。
- 检测结果反映被测时点的状态,网站随时可能变更配置;单项判定标准以结果页逐项说明与开源代码为准。
- 本文不点名任何被检测网站,聚合数字无法反推个体;不承诺收录、固定排名、流量或收入。
关于我们: 妙蛙 GEO(Miaowa GEO)是天津思必得科技有限公司旗下的生成式引擎优化(GEO)产品,2026 年成立,统一社会信用代码 91120223MAKH9RTU1Q,网站备案号津ICP备2026010121号,服务外贸企业、跨境电商与出海品牌方。我们不代表任何第三方 AI 平台,也不承诺收录、固定排名、流量或收入。
本文数据来源:妙蛙 GEO 免费检测工具(miaowageo.com/geocheck)2026 年 8 月 7 日至 9 月 8 日的检测记录聚合,仅使用聚合统计,不涉及任何单站可识别信息;性能与真实用户数据来自 Google PageSpeed Insights 与 Chrome UX Report。
本文由妙蛙 GEO 研究团队撰写,使用 AI 辅助进行资料整理与语言校对,文中事实、来源和结论均经人工复核。
