数据核对时间:2026 年 8 月
一份合格的 GEO 报告至少包含六类指标:可见度分数、竞品声量份额(SoV)、引用份额与信源 URL、推荐率与出现位置、情感与描述准确性、AI 来源流量。但比指标更关键的是方法论披露——缺少"提示词集合规模"和"每个提示词的采样次数"这两项说明的报告,所有数字都不可验证。
这篇文章给出每个指标的定义、公式、2026 年参考基准,以及一张可以直接拿去验收的清单。
一、六类核心指标
1. 可见度分数(Visibility Score)
定义:品牌在被测提示词中出现的比例,是这套体系的主 KPI,相当于传统搜索里的"展现量"。
公式:可见度分数 =(品牌出现的提示词数 ÷ 提示词总数)× 100
参考基准:单看这个数字没有意义。30% 是高是低,完全取决于竞品在哪——所以它必须和下一个指标一起读。作为一个粗略的锚点,有第三方对 311 个泛行业域名的评估显示,AEO 就绪度中位数约为 46/100(Foglift,2026 年第二季度);在 B2B SaaS 这类竞争充分的品类里,头部品牌的 AI 可见度评分约 84 分、中位数约 62 分(Data-Mania,2026 年)。
2. 声量份额(Share of Voice, SoV)
定义:在同一套提示词下,你相对竞品的相对存在感。
公式:SoV =(提及你的回答数 ÷ 该提示词集合的回答总数)× 100
为什么必须有:没有竞品集的可见度数字无法解读。而且它是唯一能区分"优化生效"和"引擎变化"的手段——如果你和竞品同步上涨,多半是引擎变了;只有你涨,才可能是优化起了作用。
基准参考:品类内的差距通常比想象中大。有研究显示,B2B SaaS 领域头部品牌获得的 AI 引用量约为竞品的 8.4 倍(Data-Mania,2026 年)。
3. 引用份额(Citation Share)与信源 URL
定义:AI 回答引用你的域名作为来源的比例,以及具体引用了哪些页面。
公式:引用份额 =(引用你域名的次数 ÷ 该提示词集合的全部引用次数)× 100
这是最有行动价值的一层。 因为它直接告诉你问题出在哪:
- AI 引用的是你的官网 → 内容方向对,可继续加强
- AI 引用的是 B2B 平台、行业媒体、社区帖子 → 问题在站外,改官网没用
- AI 提到你但不引用任何来源 → 品牌实体已被认知,但缺可引用的落地内容
对外贸企业来说,第二种情况非常常见——AI 说"中国有若干家做这个的供应商",然后引用的是阿里国际站或某个行业目录,而不是你的独立站。
必须警惕的隐藏损失:所谓"幽灵引用"(ghost citation),即 AI 使用了你的内容但不给出处。这部分在推荐流量统计里完全看不到,只能靠回答原文比对发现。
4. 推荐率与出现位置
定义:这两项衡量的是提及的质量,而不是数量。
公式:推荐率 = 被列为可选或首选供应商的次数 ÷ 提及总次数
举例:100 个提示词产生 35 次提及,其中 12 次构成实质推荐,推荐率是 12%,不是 35%。
为什么位置重要:有汇总数据显示,首位引用的转化率约为第三位提及的 2.8 倍(QuickSEO 汇总,2026 年)。只统计"有没有被提到"会掩盖掉这个差距。
5. 情感与描述准确性
定义:AI 提到你的时候,语气是正面、中性还是负面;以及它对你的事实性描述对不对。
对外贸和跨境企业来说,这一项常常比"有没有被提到"更要命。 成立年份、认证资质(CE、FDA、ISO)、产能、起订量、主营品类、工厂还是贸易公司——这些信息一旦被说错,等于 AI 在替你向买家做负面报价。
好消息是,这类问题的修复成本通常最低、见效最快,往往几天内就能改掉。所以任何报告都应该把"错误描述"单列一节,而不是混在情感分数里。
6. AI 来源流量与业务指标
定义:从 AI 平台实际点击进入网站的访问,以及后续的询盘/注册/成交。
必须说明的局限:这一层会大量丢失。AI 带来的访问常被分析工具记为"直接流量",而且相当比例的 AI 回答不提供可点击来源。目前只有约 14% 的营销人把 AI 搜索当作独立渠道跟踪。
所以正确的读法是:把前五类可见度指标当作先行指标,把流量和询盘当作滞后指标,不要因为流量层看不到数字就否定前面的结果。具体归因方法见GEO 效果怎么衡量。
二、提及、引用、推荐必须分开统计
这是判断一份报告专业与否最快的方法。三个概念含义完全不同:
| 概念 | 含义 | 说明 |
|---|---|---|
| 提及(Mention) | 回答里出现了你的品牌名 | 门槛最低 |
| 引用(Citation) | 回答引用了你的域名作为来源 | 品牌可以被提及但不被引用 |
| 推荐(Recommendation) | 回答把你列为可选或首选供应商 | 商业价值最高 |
混着算,数字会明显虚高。 一份把三者合并成一个"可见度"数字的报告,你无法判断它到底说了什么。
三、方法论披露清单:报告的可信度全在这里
这一节是本文的重点。指标是标准化的,方法论不是——而所有的数字水分都藏在方法论里。
一份可验证的报告必须写明以下七项:
1. 提示词全集 完整列出,不只是给个数量。并且要能看出这些问题是买家真会问的("best XX supplier in China"),而不是加了品牌名的定制问句——加上品牌名,命中率天然接近 100%。
行业里的常见问题是,多数 B2B 品牌只跟踪 5–10 个提示词,而可信度量需要 50 个以上。业内对提示词库的建议是覆盖品牌词、品类词、对比词、替代方案词四类集群。
2. 每个提示词的运行次数 这是最容易被省略、也最致命的一项。生成式引擎输出高度不稳定:Profound 在其购物类研究中的做法是对同一提示词运行 10 次以上,才把某个出现率视为稳定值;其数据显示,ChatGPT Shopping 中约 95% 的商品标题在同一提示词的重复运行中出现率不足 30%。
含义:跑一次得到的"没出现",可能只是这次没抽到。单次采样不是测量,是抽奖。
3. 时间窗口 具体日期,不是"近期"。因为 Google AI Mode 与 ChatGPT 引用的来源每月有 40%–60% 发生变化(Search Engine Land 相关统计,2025–2026),跨月的数据不能直接混在一起。
4. 采集环境 网页端还是 API、是否清除会话历史与个性化、使用哪个地区的网络环境、有没有登录账号。这些都会影响结果,尤其是地区——测海外买家看到什么,不能用国内网络环境采集。
5. 竞品集与选取依据 列出具体是哪几家,以及为什么选它们。竞品集由乙方随意挑选,SoV 就失去意义。
6. 引擎清单 具体覆盖哪些引擎,以及各引擎的数据是否分开呈现。不同引擎的结果差异很大,合并成一个总分会掩盖关键信息——一个品牌完全可能在 ChatGPT 上领先、在 Perplexity 上落后。
7. 原始数据 AI 回答原文、引用 URL、采集时间戳能否导出。这是将来复测和验收的唯一依据。
四、五类应该警惕的"报告"
- 只有截图的——单次采样无统计意义(见上一节)
- 没有分母的——"12% 的声量份额",在多少个提示词、多少次引用里算出来的?没有分母的百分比是营销话术,不是测量结果
- 没有竞品的——你无法判断自己的数字算好还是坏
- 没有时间戳的——数据无法复现,也无法用于前后对比
- 指标名自创且无公式的——"AI 首答率""智能推荐指数"这类词如果不给计算方式,通常是为了避免被验证
五、一页验收清单
拿到任何一份 GEO 报告,按这 12 条逐项打勾。能过 9 条以上的,基本可用于决策和验收。
方法论(决定数据可不可信)
- [ ] 完整列出了提示词全集,且不含品牌名诱导型问句
- [ ] 提示词数量 ≥ 50,覆盖品牌/品类/对比/替代四类
- [ ] 写明了每个提示词的运行次数(≥ 3 次,理想 ≥ 10 次)
- [ ] 写明了采集日期区间
- [ ] 写明了采集环境(端、地区、是否清除历史)
指标(决定数据有没有用)
- [ ] 提及、引用、推荐分开统计
- [ ] 每个百分比都能看到分子与分母
- [ ] 包含竞品对照,且说明竞品选取依据
- [ ] 分引擎呈现,而非只给一个总分
- [ ] 单列"错误描述"一节
可验收性(决定这份钱花得能不能算账)
- [ ] 原始回答与引用 URL 可导出
- [ ] 给出按性价比排序的行动清单,而不是只有分数
六、报告的终点是一份行动清单
一份报告如果只给分数不给方向,它就只是数据导出。合格的报告最后应该回答:接下来该改的三件事,按性价比排序是什么。
从我们的经验看,这个清单的前几项通常是同一类东西:
- 修正 AI 对企业的事实性错误描述(成本最低、见效最快)
- 补齐 AI 引用了竞品却没引用你的那几类页面
- 解决 AI 爬虫的抓取障碍(如果存在)
- 在 AI 实际引用的第三方平台上建立提及
前三项通常几周内就能完成,第四项才需要持续投入。一份把所有建议都指向"需要长期投入"的报告,值得多问一句为什么。
常见问题
问:报告应该多久做一次? 建议 3–6 个月复测一次。业内的做法是完整审计按月或按季度进行,头部提示词每周抽查。复测必须用同一套提示词和同样的采样次数,否则数字不可比。
问:不同工具/服务商出的报告数字对不上,谁错了? 大概率都没错,是口径不同。提示词集合、运行次数、地区、是否清除历史、统计的是提及还是推荐——任何一项不同,数字就不同。所以不要跨报告比数字,要在同一套方法论下比趋势。
问:可见度多少分算及格? 没有通用及格线。参考锚点:泛行业域名的 AEO 就绪度中位数约 46/100(Foglift,2026 年第二季度);竞争充分的 B2B SaaS 品类里头部约 84 分、中位约 62 分(Data-Mania,2026 年)。但你真正该看的是和竞品的相对差距,以及自己的趋势变化。
问:报告里必须有 AI 来源流量数据吗? 最好有,但要理解它的局限。这一层会因归因缺失而系统性低估。如果一份报告把 AI 来源流量当作唯一结果指标,它会低估工作的实际效果;反过来,完全不提这一层的报告,则无法连接到业务。
问:我能自己做一份这样的报告吗? 部分可以。提示词设计、多轮采样、记录回答原文,这些都能手工完成,只是耗时。难点在信源归因和竞品对照的规模化。完整的自查方法我们公开在免费 AI 可见度自查 vs 付费检测报告。
问:这份验收清单可以用在服务商的月报上吗? 可以,而且建议写进合同。把方法论披露的七项列为交付标准,能避免掉绝大多数验收纠纷。条款写法见GEO 合同怎么签。
先看看你现在的位置
想知道一份合格的报告长什么样,最快的办法是看一份真的。
妙蛙GEO 检测报告:用买家真实会问的问题多轮采样,覆盖海内外主流 AI 引擎,包含竞品对照、信源归因与错误描述核查,交付一份可复测的基线和按性价比排序的行动清单。
作者:妙蛙GEO 研究团队 首次发布:2026 年 8 月|最后更新:2026 年 8 月|下次复核:2026 年 11 月 本文引用的基准数据均标注来源与时间。行业尚无统一的指标标准,文中公式为目前较通行的算法,采购时请以双方书面约定的口径为准。
