返回技术文章
AI可见度网站检测建站问题GEO实测

86 个网站来测了 AI 可见度:近一半在配置 AI 不看的东西,三分之二栽在 AI 真正读的地方

86 个网站在我们的免费检测工具上跑了 99 次 AI 可见度检测。聚合数据里最扎眼的不是某一项失败率,而是一个反差:46% 的网站配置了对 AI 搜索没用的 llms.txt,同时 64% 的网站栽在 AI agent 真正用来读页面的可访问性树上。本文公开全部聚合口径:AI 读不到、读不懂、不确定三层问题的逐项分布与修法。

妙蛙 GEO 研究团队9 分钟

先交代数据从哪来。 2026 年 8 月 24 日之前,86 个不同的网站在我们的免费 AI 可见度检测工具上跑了 99 次检测。本文是这批检测结果的第一次聚合分析。

三条口径先说明白:第一,全文只有聚合数字,不出现任何被检测网站的域名或可识别信息——检测是站长自己提交的,数据用于聚合研究,不用于点名。第二,每个百分比都带分母,且分母不相同:检测分浅检、深检、探针三个阶段,各阶段成功获取结果的网站数不同,没跑成功的记「未取得」,不混进分母。第三,这是自选样本——86 个站的站长是主动来测 AI 可见度的人群,偏出海、偏关注 AI,各项比例不能外推成「全网如此」,但作为「已经开始重视 AI 可见度的这批网站长什么样」的切片,它有独立的参考价值:连关注的人都普遍栽的坑,大概率是行业级的。


一、最扎眼的不是某一项,是一个反差

把全部检查项按失败率排完,最值得写的不是榜首,而是两个数字放在一起:

86 个网站检测数据的核心反差:取到内容的 69 个站中 46% 配置了 llms.txt(Google 已明确 Search 不使用、大样本研究显示对引用预测无正向贡献),而深检的 72 个站中 64% 可访问性树不合格——AI agent 真正用来读页面结构的东西
86 个网站检测数据的核心反差:取到内容的 69 个站中 46% 配置了 llms.txt(Google 已明确 Search 不使用、大样本研究显示对引用预测无正向贡献),而深检的 72 个站中 64% 可访问性树不合格——AI agent 真正用来读页面结构的东西

46% 的网站配置了 llms.txt(成功取到该路径内容的 69 个站中的 32 个)。而 Google 已明确表示 Search 不使用这个文件,Ahrefs 对 13.7 万个域名的抓取日志显示 97% 的 llms.txt 从未被读取——我们的检测工具在结果页里就写着「不建议为搜索可见性配置它」。

64% 的网站可访问性树不合格(深检成功的 72 个站中的 46 个)。可访问性树(accessibility tree)是浏览器从页面构建出的结构化视图,也是 AI agent 实际「读」页面时依赖的东西——标题层级是否真实、控件是否有名字、内容区块是否可定位。这一项不合格,意味着 agent 打开你的页面后拿到的是一堆无法定位的节点。

这两个数字合起来,就是这批网站的真实画像:在配置 AI 不看的东西上花了功夫,在 AI 真正读的地方没有设防。 llms.txt 有教程、有话题度、五分钟能配完;可访问性树没有热度,要动模板和前端结构。大家做了容易的那件事。

二、问题榜:按「AI 读不到 → 读不懂 → 不确定」三层看

单列失败率是流水账,按问题性质分三层才能指导行动。

问题三层框架与逐项失败率:读不到层——关闭 JS 无正文 16%(68 站)、对 AI 爬虫与浏览器返回不同内容 12.5%(48 站);读不懂层——可访问性树不合格 64%(72 站)、无 JSON-LD 结构化数据 40%(68 站)、H1 缺失或多个 31%(64 站);不确定层——canonical 缺失或错误 37%(68 站)、OG 标签缺失 44%(64 站)、sitemap 问题 26%(65 站)
问题三层框架与逐项失败率:读不到层——关闭 JS 无正文 16%(68 站)、对 AI 爬虫与浏览器返回不同内容 12.5%(48 站);读不懂层——可访问性树不合格 64%(72 站)、无 JSON-LD 结构化数据 40%(68 站)、H1 缺失或多个 31%(64 站);不确定层——canonical 缺失或错误 37%(68 站)、OG 标签缺失 44%(64 站)、sitemap 问题 26%(65 站)

第一层:AI 根本读不到(最严重,最少人查)

16% 的网站关掉 JavaScript 后没有正文(68 个站中 11 个 fail)。多数 AI 爬虫不执行 JS——对它们来说,这些网站等于只有一个空壳。这是全部问题里后果最重的一项:读不到,后面所有优化都不存在。

12.5% 的网站对 AI 爬虫和普通浏览器返回不同的内容(探针成功的 48 个站中 6 个)。我们的探针用不同 User-Agent 访问同一页面做差分——这 6 个站里,AI 爬虫拿到的是拦截页、验证页或空响应。多数站长不知道自己的 WAF 在这么做:探针识别出 40% 的站点位于 WAF/CDN 之后(57 个站中 23 个,其中 Cloudflare 占 32%),而这些服务的默认规则近年一直在收紧对 AI 爬虫的拦截。

这一层的自查动作最简单:关掉 JS 看一遍自己的核心页面;再用 AI 爬虫的 UA 抓一次首页,对比返回内容。两件事加起来十分钟。

第二层:AI 读到了,但读不懂

64% 可访问性树不合格(72 站中 46 个)——上文已述,这是本次数据里最高的失败率。

40% 没有任何 JSON-LD 结构化数据(68 站中 27 个 fail)。结构化数据不是万能钥匙——我们写过它在不同链路上的作用边界——但对搜索侧的实体识别,它仍是成本最低的机器可读通道。四成的站一行都没有。

31% 的 H1 有问题(64 站中 20 个 fail:缺失或多个)。H1 是页面结构的第一个锚点,在 agentic 检索时代它的权重还在上升——模型靠标题层级在文档内导航。

第三层:AI 读懂了,但不确定该信哪个版本

37% 的 canonical 缺失或指向错误(68 站中 25 个 fail)。没有 canonical,同一内容的多个 URL 会分裂权重,AI 检索时不知道该引用哪个。

44% 缺失 OG 标签(64 站中 28 个 fail)、59% 的 title 有告警(64 站中 38 个 warn,多为过长、过短或全站雷同)、66% 的 description 有问题(64 站中 fail 加 warn 42 个)。这些是页面的「自我介绍」,缺了它们,引用你的一方只能自己猜摘要。

26% 的 sitemap 有问题(65 站中 17 个 fail:缺失或格式错误)、77% 的 hreflang 有告警(64 站中 49 个 warn)——后者对单语言站影响有限,但对做多语言的出海站,这直接关系各语种 AI 可见度是分别成立的这件事。

三、这份榜单没有的东西,和它说明的问题

值得注意的是爬虫准入几乎不是问题:robots.txt 明确拦截 GPTBot、ClaudeBot、PerplexityBot 这类 AI 爬虫的站,在这批样本里是零星个例(ClaudeBot 5 个 fail 已是最多)。「中国网站都把 AI 爬虫拦在门外」这个流行说法,至少在这批主动来检测的网站里不成立。

真实的问题结构恰恰相反:门是开的,但屋里是乱的。 爬虫进得来,读不到正文(JS 依赖)、读不懂结构(可访问性树)、分不清版本(canonical)。这三件事没有一件能靠「配置一个文件」解决,它们都要动网站本身——这大概也是 llms.txt 流行而它们被忽略的原因。

四、十分钟自查清单

不用工具也能查前四项:

  1. 浏览器关掉 JavaScript,打开你最重要的三个页面——正文还在吗?
  2. 查看页面源码,搜 canonical——有吗?指向的是这个页面自己吗?
  3. application/ld+json——有吗?
  4. 数一数页面上的 <h1>——正好一个吗?
  5. 剩下的(UA 差分、可访问性树、WAF 指纹、逐项爬虫准入)需要工具:我们的检测页免费、无需注册,浅检约半分钟出结果,深检和探针会在几分钟内补全。
十分钟自查清单:关 JS 看正文、查 canonical、查 JSON-LD、数 H1 四项手动可查;UA 差分、可访问性树、WAF 指纹、逐项爬虫准入四项需要工具检测
十分钟自查清单:关 JS 看正文、查 canonical、查 JSON-LD、数 H1 四项手动可查;UA 差分、可访问性树、WAF 指纹、逐项爬虫准入四项需要工具检测

关于这个工具要说清楚的边界:它检测的是技术层的可读性与一致性——AI 能不能读到、读懂、确认你的页面。它不检测内容质量,不预测引用概率,检测分数高也不等于会被 AI 推荐——收录与引用从来是两条链路。我们不承诺收录、固定排名、流量或收入。

五、边界声明

  • 样本为 08-24 之前主动使用检测工具的 86 个网站,自选样本,各项比例不外推至全网;
  • 各项分母不同(浅检 64–68、深检 72、探针 48–57),因各阶段成功获取结果的站点数不同;「未取得」不计入分母;
  • 检测结果反映被测时点的状态,网站随时可能变更配置;
  • 单项 fail 的判定标准以检测工具结果页的逐项说明为准,本文不展开每项的完整判定逻辑;
  • 本文不点名任何被检测网站,聚合数字无法反推个体。

关于我们:妙蛙 GEO(Miaowa GEO)是天津思必得科技有限公司旗下的生成式引擎优化(GEO)产品,2026 年成立,统一社会信用代码 91120223MAKH9RTU1Q,网站备案号津ICP备2026010121号,服务外贸企业、跨境电商与出海品牌方。我们不代表任何第三方 AI 平台,也不承诺收录、固定排名、流量或收入。

本文数据来源:妙蛙 GEO 免费检测工具(miaowageo.com/check)08-24 之前的检测记录聚合,仅使用聚合统计,不涉及任何单站可识别信息。

本文由妙蛙 GEO 研究团队撰写,使用 AI 辅助进行资料整理与语言校对,文中事实、来源和结论均经人工复核。

继续阅读

相关技术文章

AI可见度新站可见性实测:从「零结果」到品牌词第一,中间的三天发生了什么

2026 年 8 月 7 日,我们在 Bing 上搜自己的品牌名,返回的是汉字字典页。8 月 10 日,同一个查询里官网排第一。这篇记录完整的观测方法、干预动作和限制条件——包括我们无法证明的部分。

AI可见度这一周,AI 可见度的三个测量口径同时出了问题(含我们自己证据链的一个洞)

点击层漏掉了引用率最高的那批页面,答案层的单平台采样被证明不成立,报表层连 Google 官方的生成式 AI 报告都出了 bug。这三件事发生在同一周,其中第一件直接命中我们自己发布过的四层证据链方法论。本文公开这个缺口,并给出修订后的口径。

AI引用新站三天进入 AI 引用:妙蛙 GEO 的 AI 搜索方法论(附 150 条观察原始口径)

一个上线三天的新域名,在 Perplexity 的 30 道无品牌提示问题中被引用 4 次,同批测试的另外四个平台各为 0 次。本文公开完整口径、观测方法和这三天做过的十件事——以及为什么我们不能说是这些事带来了那 4 次引用。