返回技术文章
AI可见度测量口径ChatGPTSearch ConsoleGEO

这一周,AI 可见度的三个测量口径同时出了问题(含我们自己证据链的一个洞)

点击层漏掉了引用率最高的那批页面,答案层的单平台采样被证明不成立,报表层连 Google 官方的生成式 AI 报告都出了 bug。这三件事发生在同一周,其中第一件直接命中我们自己发布过的四层证据链方法论。本文公开这个缺口,并给出修订后的口径。

妙蛙 GEO 编辑部14 分钟

一句话结论: 8 月 12 日到 17 日之间出现的三份材料,分别打穿了 AI 可见度测量的三个层级——点击层、答案层、报表层。如果你这几天正在做 8 月的 GEO 月报,其中至少有一项数字大概率是错的。

我们先说命中我们自己的那一项。


洞一:点击层——utm_source 漏掉的,正是引用率最高的那批

我们在 2026 年 8 月 6 日发布过《如何证明你的网站被 ChatGPT 引用了?四层证据链方法论》,把证明拆成答案层、抓取层、点击层、业务层四层。其中点击层的核心工具,是 ChatGPT 给外链附加的 utm_source=chatgpt.com 参数,我们在《GA4 里的 AI 流量》里也详细写过它的用法和已知缺口。

8 月 17 日 Search Engine Land 发布的 RESONEO 检索栈研究,指出了一个我们此前不知道的缺口:

在思考模式下,由模型自己主动打开的那些页面,展示给用户的引用里不带 `utm_source` 参数。

为什么这条要命——同一份研究给出的漏斗数据是:

61,332 个 URL   →   进入来源侧栏
 5,032 个        →   成为某条引用背后的主要来源
   759 个        →   被模型真实打开(全部在思考模式)

被真实打开的页面,74% 会被引用;只被检索、从未被打开的,只有 7%。

ChatGPT 检索漏斗:61,332 个 URL 进入来源侧栏,5,032 个成为引用主要来源,759 个被模型真实打开;被打开的 74% 会被引用,仅被检索的只有 7%
ChatGPT 检索漏斗:61,332 个 URL 进入来源侧栏,5,032 个成为引用主要来源,759 个被模型真实打开;被打开的 74% 会被引用,仅被检索的只有 7%

也就是说,引用率最高、最有价值的那 759 个页面,恰恰是不留 UTM 痕迹的那一批。用 `utm_source=chatgpt.com` 过滤来衡量 ChatGPT 曝光,你统计到的是点击,漏掉的是"读"。而"读"才是引用的前置条件。

我们的方法论要怎么改

我们此前的表述是"点击层用 UTM 参数 + 无 referrer 黑洞补偿"。这个表述现在不完整,需要补上第三个来源:

证据来源能证明不能证明
utm_source=chatgpt.com用户点了这条引用模型读了多少页
服务器日志中的 ChatGPT-User UA模型真实打开过这个页面是否最终被引用
缓存抓取日期查询最近一次有用户触发抓取的时间抓取的原因和上下文
三个证据来源能证明与不能证明的事:UTM 证明用户点了引用但不证明模型读了多少页;ChatGPT-User 日志证明模型打开过页面但不证明最终被引用;缓存抓取日期证明最近一次被触发抓取的时间
三个证据来源能证明与不能证明的事:UTM 证明用户点了引用但不证明模型读了多少页;ChatGPT-User 日志证明模型打开过页面但不证明最终被引用;缓存抓取日期证明最近一次被触发抓取的时间

第三行是这份研究提到的一个几乎没人在用的信号:有一个 API 参数可以返回某个 URL 存储副本的抓取日期。研究者的评价是,这实际上是一个近乎免费的曝光指标,但没有人在盯它。

这意味着我们此前四层证据链里的"抓取层"和"点击层"边界需要重画:`ChatGPT-User` 的日志记录不该只算抓取证据,它同时是当前唯一能覆盖那 74% 高引用率页面的观测口径。 这同时是对《服务器日志取证:用 AI 爬虫 UA 证明你的页面被抓取和检索》的一处补充:该文把 ChatGPT-User 定性为「有真人在 ChatGPT 里读了这一页」——这个定性没错,但按上面这条,它漏掉了这个 UA 在测量上的第二重身份。

如果你的 GEO 服务商给你的月报里,AI 曝光这一栏只有 GA4 的 AI Assistants 渠道数字,那这份报告是不完整的——不是因为它造假,是因为这个口径本身有结构性盲区。


洞二:答案层——单平台采样不成立,以及一组和我们此前引用的研究相反的数据

8 月 12 日,AI 可见度工具厂商 GetIntel 发布了《AI Software Index 2026》。

口径先摆出来: 126 个软件品类,每个品类约 80 个买家口吻的问题,覆盖 1,825 个品牌,最终 9,978 个有效回答(ChatGPT 5,023 条,Gemini 4,955 条)。问题投给的是消费者版应用而非开发者 API——理由是买家看到的是界面不是 API,这一点和上一篇提到的"API 不能预测产品行为"的发现方向一致。全部数据采集于 8 月 6 日单日。

结论一:三分之一的品类里,两个助手给出不同的第一名

买家打开的是 ChatGPT 还是 Gemini,直接决定了哪家公司被推荐。

这条直接否定了单平台可见度报告的有效性。 我们在《出海企业的监测方案怎么配》里写过跨平台配置的必要性,但当时给的是定性理由。现在有了一个粗略的量级:平台间分歧率约三分之一。

如果你的可见度报告只测 ChatGPT,你对自己在 AI 里的处境的了解程度,大约打了六七折。

结论二:ChatGPT 和 Gemini 对"官网"的态度截然相反

推荐产品时引用该产品自家官网的比例
ChatGPT53%
Gemini13%

Gemini 转而依赖第三方页面。而研究提到的一个细节值得警惕:Gemini 引用最多的所谓"独立来源",是其他软件公司写的博客文章,且这些公司往往和它们所写的品类毫无关系。

结论三:G2、Capterra、TrustRadius 三家加起来只占 5% 的引用

被引用最多的域名是 techradar.com(1,114 次),Reddit 第二(807 次),Zapier 第三(418 次)。

这里我们必须诚实地指出一个矛盾。

我们在《SaaS 与软件出海的 GEO 打法》《工业品与原材料出海的 AI 可见度实操指南》两篇里引用过一组数据:在 B2B 技术服务品类中,61% 的 AI 引用给了第三方"Top 10"榜单,被研究品牌的官网在前 30 个被引域名里占比为 0%。

这次的数据说 ChatGPT 有 53% 的推荐引用了产品官网。方向是反的。

我们不打算调和这两组数字。它们的口径不同——一个统计的是"被引域名的份额",一个统计的是"推荐某产品时是否引用了该产品官网",前者是域名维度的分布,后者是回答维度的条件概率。分母不同,结论自然不同。

但这恰恰是我们想让读者看见的东西:GEO 行业目前流传的大部分"结论",其差异来自口径而非事实。 我们在《内容结构化改造指南》里对照过 Princeton GEO(KDD 2024)和 C-SEO Bench(NeurIPS 2025)两项结论相反的研究,这是同一类问题的又一次出现。

任何一份不写清分母的 GEO 数据,都不该被拿来做预算决策。

这份研究的边界

发布方自己说得很清楚,我们照实转述:这是两个引擎、单日的一次快照,没有误差范围,没有同行评审;"第一名"的定义只是回答里第一个被提到的品牌,对一段有层次的回复来说这是个粗糙的度量;单次快照无法说明这些结论是否稳定。GetIntel 表示会按季度刷新——真正值得等的是 11 月那次:如果分歧率仍然接近三分之一,那才说明买家确实在从不同助手拿到不同答案。

另外,GetIntel 本身是 AI 可见度工具厂商,这份索引同时是它的营销素材。这一点和上一篇里的 RESONEO 一样,不影响数据可用,但必须写在旁边。


洞三:报表层——Google 官方的生成式 AI 报告出了 bug

这条时效性最强,也最直接。

从 8 月 12 日至 13 日前后开始,大量站长报告 Google Search Console 的效果报告出现曝光量与点击量下滑,其中生成式 AI 功能报告(该报告不显示点击)同样出现曝光下降。下滑范围过于普遍,社区判断是 bug 而非真实变化。

8 月 17 日,Search Engine Land 报道 Google 已确认该问题,起始时间为 8 月 13 日,表现为曝光量下降。

这意味着:所有在 8 月 13 日之后、基于 GSC 生成式 AI 报告出具的可见度数字,都不能作为真实变化解读。

我们知道有多少团队正在这几天出 8 月上半月的月报。如果你的报表里 AI 曝光那一栏出现了断崖,先别写复盘结论,也别急着调整内容策略——先确认这个 bug 的影响范围和回填情况。Google 目前只确认了现象,没有公布影响范围和数据回填时间表。

这个报告是 2026 年 6 月才上线的官方一方数据源,我们在《如何进入 Google AI Overviews 的引用列表》里推荐过用它来做测量。推荐依然有效,但它现在多了一条使用前提:任何异常波动,先排除平台侧故障,再谈归因。


补充:引用不是状态,是会衰减的

8 月 14 日,AI 可见度平台 Profound 提出了"引用衰减"(citation decay)这个指标概念。

我们认为这个概念方向是对的,但要提醒读者注意它的来源——这是厂商提出的商业指标,不是学术定义,目前没有公开的验证方法论。

不过它指向的问题是真实的:AI 引用有高度的时间波动性,一次截图不构成任何证据。

这一点我们在《答案层实测:用 prompt 抽样量化「AI 到底引不引用你」》里已经用固定提示词集 + 重复采样 + 波动区间的方式处理过。上面三个洞加在一起,只是把这个结论推得更硬:

  • 单一时间点的截图 → 不成立(波动性)
  • 单一平台的采样 → 不成立(三分之一分歧率)
  • 单一渠道的流量归因 → 不成立(UTM 漏掉 74% 那批)
  • 单一官方报表 → 不成立(会出 bug 且不告诉你)
四个「单一」全部不成立:单一时间点截图、单一平台采样、单一渠道流量归因、单一官方报表
四个「单一」全部不成立:单一时间点截图、单一平台采样、单一渠道流量归因、单一官方报表

一个 AI 可见度数字要成立,它至少需要:多平台、多时点、多层证据源,并且写清楚分母。


修订后的口径:一份月报应该长什么样

结合这一周的三个洞,我们把《一份合格的 GEO 报告应该包含哪些指标》里的验收清单更新了四条:

  1. 答案层必须跨平台。 至少覆盖 ChatGPT 与 Gemini 两个体系,且分别列出而非合并成一个总分。合并的总分掩盖分歧率。
  2. 答案层必须说明采样是走产品界面还是 API。 走 API 的采样测的是模型知道什么,不是用户会看到什么。
  3. 点击层必须与日志层并列呈现。 只给 GA4 的 AI Assistants 渠道数字,等于自愿放弃引用率最高的那批页面的观测。
  4. 所有比率型指标必须写明分母。 "被引用份额"和"被引用概率"是两个不同的东西,这一周的两组矛盾数据就是这么来的。

如果你在评估服务商,这四条可以直接拿去当提问清单,配合《如何挑选 GEO 服务商?7 个判断标准与 5 个避坑点》使用。


本文不能证明什么

  • 三份材料没有一份经过同行评审。 RESONEO 与 GetIntel 都是有商业利益的从业方,已在文中分别标注。
  • UTM 缺口的规模我们无法独立验证。 我们目前只能确认该现象被 RESONEO 记录,尚未在自己的观测中复现。我们会在下一轮实测中把它列入检查项,结果无论好看与否都会公开。
  • GetIntel 的三分之一分歧率是单日快照。 它可能被采集当天的模型状态、提示词构造方式或品类选择所影响。在季度刷新出来之前,这个数字只能当作量级参考,不能当作稳定基准。
  • GSC 的 bug 影响范围未知。 Google 确认了现象和起始日期,没有说明覆盖了哪些属性、是否会回填、回填到什么时点。
  • "引用衰减"目前没有公开的度量方法。 我们引用它是因为它指向的问题真实,不代表我们背书该厂商对它的具体实现。
  • 本文全部数据来自英文平台。 国内 AI 搜索的测量口径问题另有一套,我们的方法论已公开、数据尚在采集中,见《我们打算怎么测国产大模型的信源体系》

出处

  • Olivier de Segonzac,《Inside ChatGPT's retrieval stack》, Search Engine Land, 2026-08-17;原始研究报告见 think.resoneo.com
  • GetIntel,《The AI Software Index 2026》, 2026-08-12;相关报道见 The Next Web, 2026-08-13
  • Barry Schwartz,《Google Search Console Generative AI Performance Report in Search data bug》, Search Engine Land, 2026-08-17
  • Profound,《Introducing citation decay》, 2026-08-14

相关阅读


我们发布过的方法论如果被新证据推翻或补完,会公开修订并注明修订原因,而不是悄悄改掉。本文洞一即是对我们 8 月 6 日方法论的一次公开修订。

继续阅读

相关技术文章

AI可见度86 个网站来测了 AI 可见度:近一半在配置 AI 不看的东西,三分之二栽在 AI 真正读的地方

86 个网站在我们的免费检测工具上跑了 99 次 AI 可见度检测。聚合数据里最扎眼的不是某一项失败率,而是一个反差:46% 的网站配置了对 AI 搜索没用的 llms.txt,同时 64% 的网站栽在 AI agent 真正用来读页面的可访问性树上。本文公开全部聚合口径:AI 读不到、读不懂、不确定三层问题的逐项分布与修法。

AI可见度新站可见性实测:从「零结果」到品牌词第一,中间的三天发生了什么

2026 年 8 月 7 日,我们在 Bing 上搜自己的品牌名,返回的是汉字字典页。8 月 10 日,同一个查询里官网排第一。这篇记录完整的观测方法、干预动作和限制条件——包括我们无法证明的部分。

GEO 方法论如何让 ChatGPT 在回答中主动提到你的品牌

ChatGPT 的品牌提及率仅 0.59%,是所有主流 AI 中最难攻的平台。本文说明它的信源结构、为什么品牌词策略在这里行不通,以及中小企业唯一现实的切入路径。