返回技术文章
AI 引用率prompt 抽样可复现审计监测方法

答案层实测:用 prompt 抽样量化「AI 到底引不引用你」(含可复现审计模板)

打开 ChatGPT 问一句然后截图,是这个行业里最常见也最不可靠的证明。本文给出固定 prompt 集、重复采样、指标定义与波动区间说明的完整可复现流程。

妙蛙 GEO 研究团队11 分钟

# 答案层实测:用 prompt 抽样量化"AI 到底引不引用你"(含可复现审计模板)

本文是《如何证明你的网站被 AI 引用了》系列的第四篇,对应四层证据链中的 L1 答案层

打开 ChatGPT 问一句然后截图,是这个行业里最常见也最不可靠的"证明"。生成式回答本身带随机性:同一条 prompt 跑两次,结果可能完全不同。要把"我们被 AI 引用了"变成一个能写进合同、经得起复核的数字,你需要的是一套抽样方法——固定的 prompt 集、足够的重复次数、明确的指标定义,以及对波动区间的诚实说明。本文给出可以直接照做的完整流程。


一、为什么单次截图不能作为证据

三个已被公开数据验证的事实:

  1. 同题重复的结果高度不稳定。 有测评显示,在 ChatGPT 购物类回答中,95% 的商品标题在同一 prompt 的重复运行里出现率不足 30%。
  2. 月度漂移巨大。 行业普遍观察到的引用结果月度变动在 40%–60% 区间。模型更新、索引刷新、检索改写(fanout)都会造成变化。
  3. 周环比 2–4 个百分点属于正常噪声,不是效果。

所以正确的心态是:你测量的不是一个确定值,而是一个概率。"我们在这个品类里被引用的概率是 34%±6%",比"我们被引用了"有价值得多,也安全得多。


二、第一步:构建 prompt 集

这是整套方法里最考验行业理解、也最难被工具替代的一步。

规模

用途prompt 数量说明
快速方向性判断≥ 15 条低于此数无法把信号从噪声里分离出来
标准审计30–50 条覆盖 4–5 个平台,可对外交付
原创数据报告100 条以上适合做成榜单类内容资产

结构

按购买旅程分层,不要全部堆在品牌词上。一份 100 条 prompt 集的参考配比:

类型占比示例
定义类15%"什么是 GEO 优化"
品类推荐类35%"中国有哪些靠谱的 XX 设备供应商"
对比类25%"A 和 B 哪个更适合中小外贸企业"
问题解决类15%"XX 产品出口欧盟需要什么认证"
品牌类10%"XX 公司怎么样"

定义类容易拿到引用但转化意图低,品类推荐和对比类才是真正决定生意的。报告里必须分层给数,混在一起算总分会掩盖最关键的问题。

语言与地域

这一点对外贸客户尤其关键。海外买家问 ChatGPT 用英文,问的是"reliable suppliers of X in China";国内客户问豆包用中文,问的是"XX 哪家好"。两套 prompt 集必须分开建、分开算,不能互相代表。如果你的目标市场跨多个国家,还要注意同一平台在不同地区的回答差异。


三、第二步:采样

重复次数

场景每 prompt 重复次数
内部监控3–5 次
对客户交付5–10 次
对外发布数据10 次以上

有平台在其购物类研究中采用了每 prompt 10 次以上再计算比率的做法,这可以作为任何"要对外说数"的场景的下限参考。

平台覆盖

海外向:ChatGPT、Google AI Overviews / AI Mode、Perplexity、Gemini、Copilot、Claude。 国内向:豆包、DeepSeek、腾讯元宝、通义千问、夸克、Kimi、秘塔、百度 AI 搜索。

控制变量(每次采样都要记录)

  • 日期与时间
  • 平台与模型版本
  • 是否开启联网/搜索模式
  • 账号地区、语言设置
  • 是否为全新会话(务必新开会话,历史上下文会严重污染结果

记录字段

每条采样记录至少包含:prompt ID、平台、轮次、是否提及本品牌、是否给出本站链接、被引用的具体 URL、出现位置(第几个)、竞品出现名单、情感倾向(正/中/负)、原始回答存档。

最后一项不能省。原始回答是唯一能事后复核的东西。


四、第三步:算指标

核心公式

  • 引用份额 Citation Share =(你的域名被引用次数 ÷ 该 prompt 集内全部引用次数)× 100%
  • 提及率 / 声量份额 SoV =(提及你品牌的回答数 ÷ 回答总数)× 100%
  • prompt 覆盖率 =(至少出现一次你品牌的 prompt 数 ÷ prompt 总数)× 100%
  • 推荐位次 = 你在推荐列表中的平均排位

提及和引用必须分开统计。一个品牌可以被提及却没有链接:那是品牌认知;被作为信源引用并给出链接,才是内容权威。只有后者会滚雪球式地累积。

怎么看数

不要追求绝对分数。参考性的经验区间是:在竞争激烈的 B2B 品类里,5%–15% 的引用份额属于正常起步,20% 以上开始进入领先区间,品类头部在其最强平台上通常能到 25%–45%。但这些数字高度依赖 prompt 集和竞品集的选取,换一套 prompt,数字就变了

因此最有用的判断标准只有一个:在同一套 prompt 集、同一批竞品的前提下,你的份额相对竞品是在涨还是在跌。如果你从 12% 涨到 15%,而主要竞品从 18% 掉到 14%,这就是一次干净的胜利,不需要任何行业基准来背书。

平台差异必须单列

跨平台合并计算是常见错误。2026 年 2 月一份覆盖 8 个模型、约 240 万条回答、1,900 万条引用的分析给出的基线差异极大:Claude 在超过 97% 的回答中会提及品牌,Grok 和 Copilot 也超过 90%;而 Perplexity 的品牌提及率是主流平台里最低的,但 Perplexity 与 Copilot 在超过 77% 的回答中会给出外部链接(比例高于 ChatGPT)。

换句话说:在 Claude 上没被提及,说明问题很严重;在 Perplexity 上没被提及,可能只是它本来就少提品牌。基线不同,同一个数字的含义完全不同。


五、国内平台怎么测

海外平台大多有 API 或成熟的第三方监测工具,国内平台目前基本只能人工或半自动跑。几点实操建议:

  1. 必须开启联网搜索模式,否则测的是模型记忆而非当前检索结果。
  2. 必须新开会话,且尽量使用干净账号,避免个性化推荐污染。
  3. 注意生态偏向。业内的观察性结论(非官方数据,仅供参照;我们把同一批说法列为待验证假设,方法论见《我们打算怎么测国产大模型的信源体系》)是:各平台会明显偏向自家内容生态——豆包倾向抖音、今日头条;腾讯元宝重度依赖微信公众号;百度系首选百家号;千问和夸克以新闻门户加阿里生态为主;而 DeepSeek 和 Kimi 因为没有自建内容生态,反倒让搜狐、网易等传统门户占据了较大引用份额。

第 3 点对国内中小企业客户有直接策略含义:如果测出来某平台从不引用你,先看你有没有在它的生态里发过内容,而不是先怀疑官网做得不好。


六、幽灵引用:AI 用了你的内容却没提你

这是最难证明、也最容易被忽略的一类损失。AI 复述了你的观点、数据或表述,但既不提品牌也不给链接。

半自动的检测方法:

  1. 从你的原创内容里挑出独有的表述指纹——自造的框架名、特定的数字组合、独特的分类方式;
  2. 用不含品牌名的 prompt 去问各平台,看这些指纹会不会出现;
  3. 如果回答里出现了只有你写过的说法,那就是一次幽灵引用。

这个方法还有个副产品:它是判断"你的内容有没有独创性"的最好测试。如果你的文章里找不出任何独有指纹,那它对 AI 而言就是可替代的,本来也不会被优先引用。这也是为什么原创数据和榜单类内容的引用杠杆远高于科普类内容。


七、工具:什么时候该买

15 条以内的 prompt,手工跑加表格记录完全够用,而且能让你真正理解自己所在品类的 AI 回答长什么样。超过这个量级,人工成本会迅速失控。

2026 年的工具市场大致分三层:

层级代表大致价位适合谁
轻量监测Otterly.AI、LLM Pulse、ZipTie 等每月数十至一两百美元先验证"AI 搜索对我这个品类重不重要"
中端专业Peec AI、AthenaHQ 等每月约 80–300 欧/美元需要自定义 prompt、多地区、API 导出
企业级 / 老牌 SEO 套件Profound、Scrunch、Semrush AI Toolkit、Ahrefs Brand Radar每月百余美元至数千美元需要合规、SSO、与现有 SEO 数据打通

选型时问三个问题即可:① 它的 prompt 是我自己定义的,还是它给我一个固定池?②它区分提及和引用吗?③ 它的每 prompt 重复次数是多少、能不能导出原始回答?第三个问题最能筛掉不严谨的工具——拿不出原始回答的工具,给的就不是证据。

需要提醒的是:绝大多数工具对国内平台的覆盖非常有限,服务国内中小企业客户时,人工实测仍然是主力。


八、可复现审计模板(照抄即可)

表 A:prompt 清单 | ID | prompt 原文 | 类型 | 语言 | 目标市场 |

表 B:采样记录 | 采样ID | prompt ID | 平台 | 模型/模式 | 日期 | 轮次 | 是否提及 | 是否给链接 | 被引 URL | 出现位次 | 竞品名单 | 情感 | 原文存档链接 |

表 C:汇总 | 平台 | prompt 数 | 采样总数 | 提及率 | 引用份额 | 平均位次 | 环比变化 | 与竞品对比 |

交付时必须附带的方法论声明:

本次审计使用 X 条 prompt,覆盖 Y 个平台,每条 prompt 重复采样 Z 次,采样窗口为 MM 月 DD 日至 MM 月 DD 日,均在新会话、开启联网模式下进行。生成式回答存在固有随机性,行业观察到的月度引用漂移在 40%–60% 区间,周环比 2–4 个百分点属正常波动。本报告结论应以趋势与竞品相对位置解读,不宜以单次绝对值作为效果判据。


常见问题 FAQ

Q1:最少需要多少条 prompt? 15 条可以给出方向性判断,30–50 条才适合对外交付。低于 15 条,结论基本无法与随机波动区分。

Q2:为什么我今天测到被引用,明天就没有了? 这是正常现象。模型采样随机性、索引刷新、模型版本更新都会造成波动。判断依据应该是多周趋势,不是单日结果。

Q3:提及率和引用份额哪个更重要? 看目标。要品牌认知看提及率,要可持续的信源地位和引流看引用份额。后者更难做,但会累积。

Q4:多久做一次完整审计? 完整审计每月一次,核心 prompt 每周抽查。频率再高,读到的多半是噪声。

Q5:可以只测品牌词吗? 不建议。品牌词能被引用是基本盘,真正决定生意的是"品类推荐"和"XX 哪家好"这类不含你品牌名的 prompt——那才是新客户实际会问的话。


延伸阅读

继续阅读

相关技术文章

GEO 方法论如何让 ChatGPT 在回答中主动提到你的品牌

ChatGPT 的品牌提及率仅 0.59%,是所有主流 AI 中最难攻的平台。本文说明它的信源结构、为什么品牌词策略在这里行不通,以及中小企业唯一现实的切入路径。

GEO 方法论第三方媒体投放在 GEO 中的作用与投放清单

先讲不该买什么:Google 已明确点名'追求不真实的提及'无效且有反制系统。本文区分'买提及'与'赢得报道',给出中英双市场的媒体优先级和真实的成本预期。

GEO 方法论品牌负面信息出现在 AI 回答里,怎么处理

先判断是事实错误还是真实负面——两者的处理路径完全相反。本文给出分类诊断流程、各平台的更正机制,以及为什么'AI 洗白'服务是负期望值动作。