# 答案层实测:用 prompt 抽样量化"AI 到底引不引用你"(含可复现审计模板)
本文是《如何证明你的网站被 AI 引用了》系列的第四篇,对应四层证据链中的 L1 答案层。
打开 ChatGPT 问一句然后截图,是这个行业里最常见也最不可靠的"证明"。生成式回答本身带随机性:同一条 prompt 跑两次,结果可能完全不同。要把"我们被 AI 引用了"变成一个能写进合同、经得起复核的数字,你需要的是一套抽样方法——固定的 prompt 集、足够的重复次数、明确的指标定义,以及对波动区间的诚实说明。本文给出可以直接照做的完整流程。
一、为什么单次截图不能作为证据
三个已被公开数据验证的事实:
- 同题重复的结果高度不稳定。 有测评显示,在 ChatGPT 购物类回答中,95% 的商品标题在同一 prompt 的重复运行里出现率不足 30%。
- 月度漂移巨大。 行业普遍观察到的引用结果月度变动在 40%–60% 区间。模型更新、索引刷新、检索改写(fanout)都会造成变化。
- 周环比 2–4 个百分点属于正常噪声,不是效果。
所以正确的心态是:你测量的不是一个确定值,而是一个概率。"我们在这个品类里被引用的概率是 34%±6%",比"我们被引用了"有价值得多,也安全得多。
二、第一步:构建 prompt 集
这是整套方法里最考验行业理解、也最难被工具替代的一步。
规模
| 用途 | prompt 数量 | 说明 |
|---|---|---|
| 快速方向性判断 | ≥ 15 条 | 低于此数无法把信号从噪声里分离出来 |
| 标准审计 | 30–50 条 | 覆盖 4–5 个平台,可对外交付 |
| 原创数据报告 | 100 条以上 | 适合做成榜单类内容资产 |
结构
按购买旅程分层,不要全部堆在品牌词上。一份 100 条 prompt 集的参考配比:
| 类型 | 占比 | 示例 |
|---|---|---|
| 定义类 | 15% | "什么是 GEO 优化" |
| 品类推荐类 | 35% | "中国有哪些靠谱的 XX 设备供应商" |
| 对比类 | 25% | "A 和 B 哪个更适合中小外贸企业" |
| 问题解决类 | 15% | "XX 产品出口欧盟需要什么认证" |
| 品牌类 | 10% | "XX 公司怎么样" |
定义类容易拿到引用但转化意图低,品类推荐和对比类才是真正决定生意的。报告里必须分层给数,混在一起算总分会掩盖最关键的问题。
语言与地域
这一点对外贸客户尤其关键。海外买家问 ChatGPT 用英文,问的是"reliable suppliers of X in China";国内客户问豆包用中文,问的是"XX 哪家好"。两套 prompt 集必须分开建、分开算,不能互相代表。如果你的目标市场跨多个国家,还要注意同一平台在不同地区的回答差异。
三、第二步:采样
重复次数
| 场景 | 每 prompt 重复次数 |
|---|---|
| 内部监控 | 3–5 次 |
| 对客户交付 | 5–10 次 |
| 对外发布数据 | 10 次以上 |
有平台在其购物类研究中采用了每 prompt 10 次以上再计算比率的做法,这可以作为任何"要对外说数"的场景的下限参考。
平台覆盖
海外向:ChatGPT、Google AI Overviews / AI Mode、Perplexity、Gemini、Copilot、Claude。 国内向:豆包、DeepSeek、腾讯元宝、通义千问、夸克、Kimi、秘塔、百度 AI 搜索。
控制变量(每次采样都要记录)
- 日期与时间
- 平台与模型版本
- 是否开启联网/搜索模式
- 账号地区、语言设置
- 是否为全新会话(务必新开会话,历史上下文会严重污染结果)
记录字段
每条采样记录至少包含:prompt ID、平台、轮次、是否提及本品牌、是否给出本站链接、被引用的具体 URL、出现位置(第几个)、竞品出现名单、情感倾向(正/中/负)、原始回答存档。
最后一项不能省。原始回答是唯一能事后复核的东西。
四、第三步:算指标
核心公式
- 引用份额 Citation Share =(你的域名被引用次数 ÷ 该 prompt 集内全部引用次数)× 100%
- 提及率 / 声量份额 SoV =(提及你品牌的回答数 ÷ 回答总数)× 100%
- prompt 覆盖率 =(至少出现一次你品牌的 prompt 数 ÷ prompt 总数)× 100%
- 推荐位次 = 你在推荐列表中的平均排位
提及和引用必须分开统计。一个品牌可以被提及却没有链接:那是品牌认知;被作为信源引用并给出链接,才是内容权威。只有后者会滚雪球式地累积。
怎么看数
不要追求绝对分数。参考性的经验区间是:在竞争激烈的 B2B 品类里,5%–15% 的引用份额属于正常起步,20% 以上开始进入领先区间,品类头部在其最强平台上通常能到 25%–45%。但这些数字高度依赖 prompt 集和竞品集的选取,换一套 prompt,数字就变了。
因此最有用的判断标准只有一个:在同一套 prompt 集、同一批竞品的前提下,你的份额相对竞品是在涨还是在跌。如果你从 12% 涨到 15%,而主要竞品从 18% 掉到 14%,这就是一次干净的胜利,不需要任何行业基准来背书。
平台差异必须单列
跨平台合并计算是常见错误。2026 年 2 月一份覆盖 8 个模型、约 240 万条回答、1,900 万条引用的分析给出的基线差异极大:Claude 在超过 97% 的回答中会提及品牌,Grok 和 Copilot 也超过 90%;而 Perplexity 的品牌提及率是主流平台里最低的,但 Perplexity 与 Copilot 在超过 77% 的回答中会给出外部链接(比例高于 ChatGPT)。
换句话说:在 Claude 上没被提及,说明问题很严重;在 Perplexity 上没被提及,可能只是它本来就少提品牌。基线不同,同一个数字的含义完全不同。
五、国内平台怎么测
海外平台大多有 API 或成熟的第三方监测工具,国内平台目前基本只能人工或半自动跑。几点实操建议:
- 必须开启联网搜索模式,否则测的是模型记忆而非当前检索结果。
- 必须新开会话,且尽量使用干净账号,避免个性化推荐污染。
- 注意生态偏向。业内的观察性结论(非官方数据,仅供参照;我们把同一批说法列为待验证假设,方法论见《我们打算怎么测国产大模型的信源体系》)是:各平台会明显偏向自家内容生态——豆包倾向抖音、今日头条;腾讯元宝重度依赖微信公众号;百度系首选百家号;千问和夸克以新闻门户加阿里生态为主;而 DeepSeek 和 Kimi 因为没有自建内容生态,反倒让搜狐、网易等传统门户占据了较大引用份额。
第 3 点对国内中小企业客户有直接策略含义:如果测出来某平台从不引用你,先看你有没有在它的生态里发过内容,而不是先怀疑官网做得不好。
六、幽灵引用:AI 用了你的内容却没提你
这是最难证明、也最容易被忽略的一类损失。AI 复述了你的观点、数据或表述,但既不提品牌也不给链接。
半自动的检测方法:
- 从你的原创内容里挑出独有的表述指纹——自造的框架名、特定的数字组合、独特的分类方式;
- 用不含品牌名的 prompt 去问各平台,看这些指纹会不会出现;
- 如果回答里出现了只有你写过的说法,那就是一次幽灵引用。
这个方法还有个副产品:它是判断"你的内容有没有独创性"的最好测试。如果你的文章里找不出任何独有指纹,那它对 AI 而言就是可替代的,本来也不会被优先引用。这也是为什么原创数据和榜单类内容的引用杠杆远高于科普类内容。
七、工具:什么时候该买
15 条以内的 prompt,手工跑加表格记录完全够用,而且能让你真正理解自己所在品类的 AI 回答长什么样。超过这个量级,人工成本会迅速失控。
2026 年的工具市场大致分三层:
| 层级 | 代表 | 大致价位 | 适合谁 |
|---|---|---|---|
| 轻量监测 | Otterly.AI、LLM Pulse、ZipTie 等 | 每月数十至一两百美元 | 先验证"AI 搜索对我这个品类重不重要" |
| 中端专业 | Peec AI、AthenaHQ 等 | 每月约 80–300 欧/美元 | 需要自定义 prompt、多地区、API 导出 |
| 企业级 / 老牌 SEO 套件 | Profound、Scrunch、Semrush AI Toolkit、Ahrefs Brand Radar | 每月百余美元至数千美元 | 需要合规、SSO、与现有 SEO 数据打通 |
选型时问三个问题即可:① 它的 prompt 是我自己定义的,还是它给我一个固定池?②它区分提及和引用吗?③ 它的每 prompt 重复次数是多少、能不能导出原始回答?第三个问题最能筛掉不严谨的工具——拿不出原始回答的工具,给的就不是证据。
需要提醒的是:绝大多数工具对国内平台的覆盖非常有限,服务国内中小企业客户时,人工实测仍然是主力。
八、可复现审计模板(照抄即可)
表 A:prompt 清单 | ID | prompt 原文 | 类型 | 语言 | 目标市场 |
表 B:采样记录 | 采样ID | prompt ID | 平台 | 模型/模式 | 日期 | 轮次 | 是否提及 | 是否给链接 | 被引 URL | 出现位次 | 竞品名单 | 情感 | 原文存档链接 |
表 C:汇总 | 平台 | prompt 数 | 采样总数 | 提及率 | 引用份额 | 平均位次 | 环比变化 | 与竞品对比 |
交付时必须附带的方法论声明:
本次审计使用 X 条 prompt,覆盖 Y 个平台,每条 prompt 重复采样 Z 次,采样窗口为 MM 月 DD 日至 MM 月 DD 日,均在新会话、开启联网模式下进行。生成式回答存在固有随机性,行业观察到的月度引用漂移在 40%–60% 区间,周环比 2–4 个百分点属正常波动。本报告结论应以趋势与竞品相对位置解读,不宜以单次绝对值作为效果判据。
常见问题 FAQ
Q1:最少需要多少条 prompt? 15 条可以给出方向性判断,30–50 条才适合对外交付。低于 15 条,结论基本无法与随机波动区分。
Q2:为什么我今天测到被引用,明天就没有了? 这是正常现象。模型采样随机性、索引刷新、模型版本更新都会造成波动。判断依据应该是多周趋势,不是单日结果。
Q3:提及率和引用份额哪个更重要? 看目标。要品牌认知看提及率,要可持续的信源地位和引流看引用份额。后者更难做,但会累积。
Q4:多久做一次完整审计? 完整审计每月一次,核心 prompt 每周抽查。频率再高,读到的多半是噪声。
Q5:可以只测品牌词吗? 不建议。品牌词能被引用是基本盘,真正决定生意的是"品类推荐"和"XX 哪家好"这类不含你品牌名的 prompt——那才是新客户实际会问的话。
延伸阅读
