本文只有方法论,没有数据。 数据要等我们真正跑完测试才会发布——这正是本文存在的意义。
国内关于「哪个 AI 平台偏好什么信源」的说法很多,但我们没有找到任何一份公开了样本量、问题清单和统计口径的。 没有方法论的数字,不能作为决策依据。
所以我们决定先把自己的测试方法完整公开出来,接受质疑和改进建议,然后再去跑数据。顺序反过来,是为了让结论出来的那一刻就是可核查的。
一、为什么先发方法论,而不是先发数据
行业里通行的做法是反过来的:先给出一组好看的数字,被追问时再补方法论——或者永远不补。
我们不这么做,有两个原因。
第一,没有方法论的数字会污染我们自己的可信度。 中文网络上现有的「国产 AI 信源偏好」数据,大量出自服务商推广内容,典型说法如「收录速度快 4–7 倍」「引用权重高 3 倍」,均无公开方法论、无样本量、无统计口径。转述它们,等于把我们的可信度绑在无法核查的数据上。
第二,方法论先公开,错误能被更早发现。 如果我们的问题集设计有偏差、统计口径有漏洞,最好是在跑数据之前就被指出来,而不是在结论发布后被推翻。欢迎质疑本文的任何一条设计。
这也是我们对客户交付报告时的同一条原则:结论可以有分歧,方法必须可核查。
二、这份测试要回答的问题
它要解决企业的一个具体决策:内容预算该往哪儿投。
如果某个平台的信源高度集中在某个封闭生态,而你的客户主要用这个平台,那么再多的官网优化都不如把该生态里的内容做起来。这类判断必须建立在数据上,不能靠感觉。
具体到指标,我们要回答六个问题:
- 各平台回答商业问题时,有多大比例会真的去联网检索?
- 每次检索平均引用几条信源?
- 信源域名分布长什么样,生态集中度有多高?
- 企业自有官网在引用里占多大比例?
- 同一个问题在不同平台的引用集合重合度有多高——「一稿通发」到底行不行?
- 同一个问题问三次,结果稳定吗?
三、测试方法(可复现)
3.1 问题集设计
问题分四类,每类等量,覆盖真实商业意图:
| 问题类型 | 示例 | 对应商业意图 |
|---|---|---|
| 品牌推荐类 | 「XX 设备哪家厂商比较好」 | 最高,直接影响成交 |
| 选型决策类 | 「小型冷库选风冷还是水冷」 | 高,影响供应商筛选 |
| 参数事实类 | 「304 和 316 不锈钢的区别」 | 中,建立专业认知 |
| 品牌核实类 | 「XX 公司怎么样/可靠吗」 | 高,影响临门一脚 |
行业覆盖六个方向,各类问题在行业间均分:机械设备、化工原材料、家居建材、3C 电子、专业服务、本地服务。
问题总数在正式开测前确定并公布——先定问题集再跑数据,不允许跑完之后回头增删问题。这一条是防止选择性报告的关键。
3.2 测试条件
- 时间窗口:全部问题在同一周内跑完,避免平台版本更新造成横向不可比
- 账号状态:全部使用未登录或全新账号,关闭个性化与历史记忆
- 联网设置:保持默认状态,不手动开启「联网搜索」——我们要测的是真实用户会遇到的情况,不是最理想情况
- 重复次数:每题重复 3 次,取并集统计信源,同时单独记录三次结果的重合度
- 留档:全程录屏
3.3 统计指标
| 指标 | 定义 | 为什么重要 |
|---|---|---|
| 联网触发率 | 回答中出现外部引用的比例 | 不联网 = 内容优化完全无效 |
| 平均引用条数 | 每个回答标注的信源数量 | 决定「挤进去」的难度 |
| 信源域名分布 | 按域名统计出现频次 | 决定投放渠道优先级 |
| 生态集中度 | Top3 域名占全部引用的比例 | 越高越说明存在生态围墙 |
| 内容平均年龄 | 被引用页面的发布距今时长 | 决定内容更新频率 |
| 官网入选率 | 引用中企业自有官网的占比 | 决定官网 vs 站外的预算分配 |
| 跨平台重合度 | 同一问题在两家平台引用集合的 Jaccard 相似度 | 决定能否「一稿通发」 |
七个指标里,跨平台重合度和联网触发率是最关键的两个。前者直接决定「一套内容打通所有 AI」这个说法成不成立;后者决定在某个平台做内容优化有没有意义——如果一个平台大部分回答根本不检索外部网页,那么在它上面做 GEO 的边际收益极低。
四、待验证的六条假设
以下说法在行业内流传很广,但我们没有找到任何一份公开了方法论的验证。它们是本次测试要检验的假设,不是结论——测试结果可能确认它们,也可能推翻它们。
- DeepSeek 偏向技术社区与学术型内容
- 豆包的信源与字节系内容生态存在关联
- 腾讯元宝的信源向微信生态倾斜
- 通义千问与阿里系内容存在关联
- 秘塔偏向学术与文献型来源
- 百度系 AI 与传统百度收录高度绑定
把假设写在前面,是为了让读者能对照最终结果,判断我们有没有在事后重新解释数据。
如果你手上有相反的观察,欢迎在测试开始前告诉我们——这会帮助我们调整问题集,避免只测出我们预期的东西。
五、已知局限
任何一份测评的局限性都是它可信度的一部分。这次测试注定有以下几条,数据发布时这一节会保留并更新:
- 样本量有限,行业覆盖不均衡,结论不宜外推到未测试的行业
- 各平台版本迭代频繁,结论仅代表测试时间窗口内的状态,超过三个月参考价值会明显下降
- 未登录账号的结果与真实用户不同——真实用户有历史行为和个性化,结果可能存在差异
- 信源统计无法区分「被引用」与「被采用但未署名」,内容的实际影响可能被低估
- 只统计可见引用,模型内化的训练语料知识不在测量范围内
六、下一步
方法论公开后,我们会做三件事:
- 收集对本方法论的质疑与改进建议,修订后确定最终版
- 确定并公布问题集全文
- 执行测试,发布数据与原始记录
数据发布后,本文会更新为完整版,并保留方法论的修订记录。计划每季度重跑一次,形成连载。
常见问题
Q1:为什么现在不直接给数据?
因为我们还没跑。行业里先给数字、被追问时再补方法论(或永不补)的做法,我们不打算跟。等数据出来,本文会更新为完整版。
Q2:测试范围为什么是这六家?
覆盖国内目前用户量较大的通用 AI 助手与 AI 搜索产品。百度系 AI 搜索与文心是否纳入,会在最终版方法论中说明取舍理由——纳入与否都会给出依据,不会默默跳过。
Q3:数据多久更新一次?
计划每季度一次。AI 平台迭代速度快,超过三个月的信源分布数据参考价值会明显下降。
Q4:为什么其他机构给出的数字和你们不一样?
统计口径不同会导致结果差异巨大——是否登录、是否手动开启联网、每题测几次、如何处理重复域名,都会影响结果。这也是我们先公开方法论的原因:结论可以有分歧,方法必须可核查。
Q5:我可以用这套方法自己测吗?
可以,本文的目的之一就是让它可复现。如果你测出了和我们不同的结果,我们很想知道——差异本身往往比结论更有信息量。
