一句话结论: 8 月 12 日到 17 日之间出现的三份材料,分别打穿了 AI 可见度测量的三个层级——点击层、答案层、报表层。如果你这几天正在做 8 月的 GEO 月报,其中至少有一项数字大概率是错的。
我们先说命中我们自己的那一项。
洞一:点击层——utm_source 漏掉的,正是引用率最高的那批
我们在 2026 年 8 月 6 日发布过《如何证明你的网站被 ChatGPT 引用了?四层证据链方法论》,把证明拆成答案层、抓取层、点击层、业务层四层。其中点击层的核心工具,是 ChatGPT 给外链附加的 utm_source=chatgpt.com 参数,我们在《GA4 里的 AI 流量》里也详细写过它的用法和已知缺口。
8 月 17 日 Search Engine Land 发布的 RESONEO 检索栈研究,指出了一个我们此前不知道的缺口:
在思考模式下,由模型自己主动打开的那些页面,展示给用户的引用里不带 `utm_source` 参数。
为什么这条要命——同一份研究给出的漏斗数据是:
61,332 个 URL → 进入来源侧栏
5,032 个 → 成为某条引用背后的主要来源
759 个 → 被模型真实打开(全部在思考模式)被真实打开的页面,74% 会被引用;只被检索、从未被打开的,只有 7%。

也就是说,引用率最高、最有价值的那 759 个页面,恰恰是不留 UTM 痕迹的那一批。用 `utm_source=chatgpt.com` 过滤来衡量 ChatGPT 曝光,你统计到的是点击,漏掉的是"读"。而"读"才是引用的前置条件。
我们的方法论要怎么改
我们此前的表述是"点击层用 UTM 参数 + 无 referrer 黑洞补偿"。这个表述现在不完整,需要补上第三个来源:
| 证据来源 | 能证明 | 不能证明 |
|---|---|---|
utm_source=chatgpt.com | 用户点了这条引用 | 模型读了多少页 |
服务器日志中的 ChatGPT-User UA | 模型真实打开过这个页面 | 是否最终被引用 |
| 缓存抓取日期查询 | 最近一次有用户触发抓取的时间 | 抓取的原因和上下文 |

第三行是这份研究提到的一个几乎没人在用的信号:有一个 API 参数可以返回某个 URL 存储副本的抓取日期。研究者的评价是,这实际上是一个近乎免费的曝光指标,但没有人在盯它。
这意味着我们此前四层证据链里的"抓取层"和"点击层"边界需要重画:`ChatGPT-User` 的日志记录不该只算抓取证据,它同时是当前唯一能覆盖那 74% 高引用率页面的观测口径。 这同时是对《服务器日志取证:用 AI 爬虫 UA 证明你的页面被抓取和检索》的一处补充:该文把 ChatGPT-User 定性为「有真人在 ChatGPT 里读了这一页」——这个定性没错,但按上面这条,它漏掉了这个 UA 在测量上的第二重身份。
如果你的 GEO 服务商给你的月报里,AI 曝光这一栏只有 GA4 的 AI Assistants 渠道数字,那这份报告是不完整的——不是因为它造假,是因为这个口径本身有结构性盲区。
洞二:答案层——单平台采样不成立,以及一组和我们此前引用的研究相反的数据
8 月 12 日,AI 可见度工具厂商 GetIntel 发布了《AI Software Index 2026》。
口径先摆出来: 126 个软件品类,每个品类约 80 个买家口吻的问题,覆盖 1,825 个品牌,最终 9,978 个有效回答(ChatGPT 5,023 条,Gemini 4,955 条)。问题投给的是消费者版应用而非开发者 API——理由是买家看到的是界面不是 API,这一点和上一篇提到的"API 不能预测产品行为"的发现方向一致。全部数据采集于 8 月 6 日单日。
结论一:三分之一的品类里,两个助手给出不同的第一名
买家打开的是 ChatGPT 还是 Gemini,直接决定了哪家公司被推荐。
这条直接否定了单平台可见度报告的有效性。 我们在《出海企业的监测方案怎么配》里写过跨平台配置的必要性,但当时给的是定性理由。现在有了一个粗略的量级:平台间分歧率约三分之一。
如果你的可见度报告只测 ChatGPT,你对自己在 AI 里的处境的了解程度,大约打了六七折。
结论二:ChatGPT 和 Gemini 对"官网"的态度截然相反
| 推荐产品时引用该产品自家官网的比例 | |
|---|---|
| ChatGPT | 53% |
| Gemini | 13% |
Gemini 转而依赖第三方页面。而研究提到的一个细节值得警惕:Gemini 引用最多的所谓"独立来源",是其他软件公司写的博客文章,且这些公司往往和它们所写的品类毫无关系。
结论三:G2、Capterra、TrustRadius 三家加起来只占 5% 的引用
被引用最多的域名是 techradar.com(1,114 次),Reddit 第二(807 次),Zapier 第三(418 次)。
这里我们必须诚实地指出一个矛盾。
我们在《SaaS 与软件出海的 GEO 打法》和《工业品与原材料出海的 AI 可见度实操指南》两篇里引用过一组数据:在 B2B 技术服务品类中,61% 的 AI 引用给了第三方"Top 10"榜单,被研究品牌的官网在前 30 个被引域名里占比为 0%。
这次的数据说 ChatGPT 有 53% 的推荐引用了产品官网。方向是反的。
我们不打算调和这两组数字。它们的口径不同——一个统计的是"被引域名的份额",一个统计的是"推荐某产品时是否引用了该产品官网",前者是域名维度的分布,后者是回答维度的条件概率。分母不同,结论自然不同。
但这恰恰是我们想让读者看见的东西:GEO 行业目前流传的大部分"结论",其差异来自口径而非事实。 我们在《内容结构化改造指南》里对照过 Princeton GEO(KDD 2024)和 C-SEO Bench(NeurIPS 2025)两项结论相反的研究,这是同一类问题的又一次出现。
任何一份不写清分母的 GEO 数据,都不该被拿来做预算决策。
这份研究的边界
发布方自己说得很清楚,我们照实转述:这是两个引擎、单日的一次快照,没有误差范围,没有同行评审;"第一名"的定义只是回答里第一个被提到的品牌,对一段有层次的回复来说这是个粗糙的度量;单次快照无法说明这些结论是否稳定。GetIntel 表示会按季度刷新——真正值得等的是 11 月那次:如果分歧率仍然接近三分之一,那才说明买家确实在从不同助手拿到不同答案。
另外,GetIntel 本身是 AI 可见度工具厂商,这份索引同时是它的营销素材。这一点和上一篇里的 RESONEO 一样,不影响数据可用,但必须写在旁边。
洞三:报表层——Google 官方的生成式 AI 报告出了 bug
这条时效性最强,也最直接。
从 8 月 12 日至 13 日前后开始,大量站长报告 Google Search Console 的效果报告出现曝光量与点击量下滑,其中生成式 AI 功能报告(该报告不显示点击)同样出现曝光下降。下滑范围过于普遍,社区判断是 bug 而非真实变化。
8 月 17 日,Search Engine Land 报道 Google 已确认该问题,起始时间为 8 月 13 日,表现为曝光量下降。
这意味着:所有在 8 月 13 日之后、基于 GSC 生成式 AI 报告出具的可见度数字,都不能作为真实变化解读。
我们知道有多少团队正在这几天出 8 月上半月的月报。如果你的报表里 AI 曝光那一栏出现了断崖,先别写复盘结论,也别急着调整内容策略——先确认这个 bug 的影响范围和回填情况。Google 目前只确认了现象,没有公布影响范围和数据回填时间表。
这个报告是 2026 年 6 月才上线的官方一方数据源,我们在《如何进入 Google AI Overviews 的引用列表》里推荐过用它来做测量。推荐依然有效,但它现在多了一条使用前提:任何异常波动,先排除平台侧故障,再谈归因。
补充:引用不是状态,是会衰减的
8 月 14 日,AI 可见度平台 Profound 提出了"引用衰减"(citation decay)这个指标概念。
我们认为这个概念方向是对的,但要提醒读者注意它的来源——这是厂商提出的商业指标,不是学术定义,目前没有公开的验证方法论。
不过它指向的问题是真实的:AI 引用有高度的时间波动性,一次截图不构成任何证据。
这一点我们在《答案层实测:用 prompt 抽样量化「AI 到底引不引用你」》里已经用固定提示词集 + 重复采样 + 波动区间的方式处理过。上面三个洞加在一起,只是把这个结论推得更硬:
- 单一时间点的截图 → 不成立(波动性)
- 单一平台的采样 → 不成立(三分之一分歧率)
- 单一渠道的流量归因 → 不成立(UTM 漏掉 74% 那批)
- 单一官方报表 → 不成立(会出 bug 且不告诉你)

一个 AI 可见度数字要成立,它至少需要:多平台、多时点、多层证据源,并且写清楚分母。
修订后的口径:一份月报应该长什么样
结合这一周的三个洞,我们把《一份合格的 GEO 报告应该包含哪些指标》里的验收清单更新了四条:
- 答案层必须跨平台。 至少覆盖 ChatGPT 与 Gemini 两个体系,且分别列出而非合并成一个总分。合并的总分掩盖分歧率。
- 答案层必须说明采样是走产品界面还是 API。 走 API 的采样测的是模型知道什么,不是用户会看到什么。
- 点击层必须与日志层并列呈现。 只给 GA4 的 AI Assistants 渠道数字,等于自愿放弃引用率最高的那批页面的观测。
- 所有比率型指标必须写明分母。 "被引用份额"和"被引用概率"是两个不同的东西,这一周的两组矛盾数据就是这么来的。
如果你在评估服务商,这四条可以直接拿去当提问清单,配合《如何挑选 GEO 服务商?7 个判断标准与 5 个避坑点》使用。
本文不能证明什么
- 三份材料没有一份经过同行评审。 RESONEO 与 GetIntel 都是有商业利益的从业方,已在文中分别标注。
- UTM 缺口的规模我们无法独立验证。 我们目前只能确认该现象被 RESONEO 记录,尚未在自己的观测中复现。我们会在下一轮实测中把它列入检查项,结果无论好看与否都会公开。
- GetIntel 的三分之一分歧率是单日快照。 它可能被采集当天的模型状态、提示词构造方式或品类选择所影响。在季度刷新出来之前,这个数字只能当作量级参考,不能当作稳定基准。
- GSC 的 bug 影响范围未知。 Google 确认了现象和起始日期,没有说明覆盖了哪些属性、是否会回填、回填到什么时点。
- "引用衰减"目前没有公开的度量方法。 我们引用它是因为它指向的问题真实,不代表我们背书该厂商对它的具体实现。
- 本文全部数据来自英文平台。 国内 AI 搜索的测量口径问题另有一套,我们的方法论已公开、数据尚在采集中,见《我们打算怎么测国产大模型的信源体系》。
出处
- Olivier de Segonzac,《Inside ChatGPT's retrieval stack》, Search Engine Land, 2026-08-17;原始研究报告见 think.resoneo.com
- GetIntel,《The AI Software Index 2026》, 2026-08-12;相关报道见 The Next Web, 2026-08-13
- Barry Schwartz,《Google Search Console Generative AI Performance Report in Search data bug》, Search Engine Land, 2026-08-17
- Profound,《Introducing citation decay》, 2026-08-14
相关阅读
- 免费版 ChatGPT 根本没打开你的网页:1,200 个回答的检索栈解剖 — 本文的机制篇姊妹文
- 如何证明你的网站被 ChatGPT 引用了?四层证据链方法论(2026 版) — 本文洞一是对该文点击层口径的一处更正
- 服务器日志取证:用 AI 爬虫 UA 证明你的页面被抓取和检索 — 本文洞一补充了该文对
ChatGPT-User的定性 - GA4 里的 AI 流量:AI Assistants 渠道、utm_source=chatgpt.com 与无 referrer 黑洞
- 答案层实测:用 prompt 抽样量化「AI 到底引不引用你」(含可复现审计模板)
- 一份合格的 GEO 报告应该包含哪些指标(附验收清单)
- 警惕这 8 种 GEO 伪需求和智商税
我们发布过的方法论如果被新证据推翻或补完,会公开修订并注明修订原因,而不是悄悄改掉。本文洞一即是对我们 8 月 6 日方法论的一次公开修订。
