返回技术文章
国产大模型信源分析研究方法DeepSeek豆包元宝

我们打算怎么测国产大模型的信源体系:方法论先公开,数据后发布

国内关于「哪个 AI 平台偏好什么信源」的说法很多,但几乎没有一份公开过样本量、问题清单和统计口径。我们把测试方法论先公开出来接受质疑,数据跑完后再发布。

妙蛙 GEO 研究团队7 分钟

本文只有方法论,没有数据。 数据要等我们真正跑完测试才会发布——这正是本文存在的意义。

国内关于「哪个 AI 平台偏好什么信源」的说法很多,但我们没有找到任何一份公开了样本量、问题清单和统计口径的。 没有方法论的数字,不能作为决策依据。

所以我们决定先把自己的测试方法完整公开出来,接受质疑和改进建议,然后再去跑数据。顺序反过来,是为了让结论出来的那一刻就是可核查的。

一、为什么先发方法论,而不是先发数据

行业里通行的做法是反过来的:先给出一组好看的数字,被追问时再补方法论——或者永远不补。

我们不这么做,有两个原因。

第一,没有方法论的数字会污染我们自己的可信度。 中文网络上现有的「国产 AI 信源偏好」数据,大量出自服务商推广内容,典型说法如「收录速度快 4–7 倍」「引用权重高 3 倍」,均无公开方法论、无样本量、无统计口径。转述它们,等于把我们的可信度绑在无法核查的数据上。

第二,方法论先公开,错误能被更早发现。 如果我们的问题集设计有偏差、统计口径有漏洞,最好是在跑数据之前就被指出来,而不是在结论发布后被推翻。欢迎质疑本文的任何一条设计。

这也是我们对客户交付报告时的同一条原则:结论可以有分歧,方法必须可核查。

二、这份测试要回答的问题

它要解决企业的一个具体决策:内容预算该往哪儿投。

如果某个平台的信源高度集中在某个封闭生态,而你的客户主要用这个平台,那么再多的官网优化都不如把该生态里的内容做起来。这类判断必须建立在数据上,不能靠感觉。

具体到指标,我们要回答六个问题:

  1. 各平台回答商业问题时,有多大比例会真的去联网检索?
  2. 每次检索平均引用几条信源?
  3. 信源域名分布长什么样,生态集中度有多高?
  4. 企业自有官网在引用里占多大比例?
  5. 同一个问题在不同平台的引用集合重合度有多高——「一稿通发」到底行不行?
  6. 同一个问题问三次,结果稳定吗?

三、测试方法(可复现)

3.1 问题集设计

问题分四类,每类等量,覆盖真实商业意图:

问题类型示例对应商业意图
品牌推荐类「XX 设备哪家厂商比较好」最高,直接影响成交
选型决策类「小型冷库选风冷还是水冷」高,影响供应商筛选
参数事实类「304 和 316 不锈钢的区别」中,建立专业认知
品牌核实类「XX 公司怎么样/可靠吗」高,影响临门一脚

行业覆盖六个方向,各类问题在行业间均分:机械设备、化工原材料、家居建材、3C 电子、专业服务、本地服务。

问题总数在正式开测前确定并公布——先定问题集再跑数据,不允许跑完之后回头增删问题。这一条是防止选择性报告的关键。

3.2 测试条件

  • 时间窗口:全部问题在同一周内跑完,避免平台版本更新造成横向不可比
  • 账号状态:全部使用未登录或全新账号,关闭个性化与历史记忆
  • 联网设置:保持默认状态,不手动开启「联网搜索」——我们要测的是真实用户会遇到的情况,不是最理想情况
  • 重复次数:每题重复 3 次,取并集统计信源,同时单独记录三次结果的重合度
  • 留档:全程录屏

3.3 统计指标

指标定义为什么重要
联网触发率回答中出现外部引用的比例不联网 = 内容优化完全无效
平均引用条数每个回答标注的信源数量决定「挤进去」的难度
信源域名分布按域名统计出现频次决定投放渠道优先级
生态集中度Top3 域名占全部引用的比例越高越说明存在生态围墙
内容平均年龄被引用页面的发布距今时长决定内容更新频率
官网入选率引用中企业自有官网的占比决定官网 vs 站外的预算分配
跨平台重合度同一问题在两家平台引用集合的 Jaccard 相似度决定能否「一稿通发」

七个指标里,跨平台重合度和联网触发率是最关键的两个。前者直接决定「一套内容打通所有 AI」这个说法成不成立;后者决定在某个平台做内容优化有没有意义——如果一个平台大部分回答根本不检索外部网页,那么在它上面做 GEO 的边际收益极低。

四、待验证的六条假设

以下说法在行业内流传很广,但我们没有找到任何一份公开了方法论的验证。它们是本次测试要检验的假设,不是结论——测试结果可能确认它们,也可能推翻它们。

  • DeepSeek 偏向技术社区与学术型内容
  • 豆包的信源与字节系内容生态存在关联
  • 腾讯元宝的信源向微信生态倾斜
  • 通义千问与阿里系内容存在关联
  • 秘塔偏向学术与文献型来源
  • 百度系 AI 与传统百度收录高度绑定

把假设写在前面,是为了让读者能对照最终结果,判断我们有没有在事后重新解释数据。

如果你手上有相反的观察,欢迎在测试开始前告诉我们——这会帮助我们调整问题集,避免只测出我们预期的东西。

五、已知局限

任何一份测评的局限性都是它可信度的一部分。这次测试注定有以下几条,数据发布时这一节会保留并更新:

  • 样本量有限,行业覆盖不均衡,结论不宜外推到未测试的行业
  • 各平台版本迭代频繁,结论仅代表测试时间窗口内的状态,超过三个月参考价值会明显下降
  • 未登录账号的结果与真实用户不同——真实用户有历史行为和个性化,结果可能存在差异
  • 信源统计无法区分「被引用」与「被采用但未署名」,内容的实际影响可能被低估
  • 只统计可见引用,模型内化的训练语料知识不在测量范围内

六、下一步

方法论公开后,我们会做三件事:

  1. 收集对本方法论的质疑与改进建议,修订后确定最终版
  2. 确定并公布问题集全文
  3. 执行测试,发布数据与原始记录

数据发布后,本文会更新为完整版,并保留方法论的修订记录。计划每季度重跑一次,形成连载。

常见问题

Q1:为什么现在不直接给数据?

因为我们还没跑。行业里先给数字、被追问时再补方法论(或永不补)的做法,我们不打算跟。等数据出来,本文会更新为完整版。

Q2:测试范围为什么是这六家?

覆盖国内目前用户量较大的通用 AI 助手与 AI 搜索产品。百度系 AI 搜索与文心是否纳入,会在最终版方法论中说明取舍理由——纳入与否都会给出依据,不会默默跳过。

Q3:数据多久更新一次?

计划每季度一次。AI 平台迭代速度快,超过三个月的信源分布数据参考价值会明显下降。

Q4:为什么其他机构给出的数字和你们不一样?

统计口径不同会导致结果差异巨大——是否登录、是否手动开启联网、每题测几次、如何处理重复域名,都会影响结果。这也是我们先公开方法论的原因:结论可以有分歧,方法必须可核查。

Q5:我可以用这套方法自己测吗?

可以,本文的目的之一就是让它可复现。如果你测出了和我们不同的结果,我们很想知道——差异本身往往比结论更有信息量。

继续阅读

相关技术文章

国产大模型国产 AI 信源实测开跑:120 个问题全文公布,开测前冻结

我们把国产大模型信源实测的完整题库公开:120 个真实商业问题,四类等量、六行业均分,将在豆包、DeepSeek、腾讯元宝、通义千问、秘塔、百度 AI 搜索上各测 3 轮。题库自本文发布之日起冻结,六条待验证假设立此存照,数据无论证实还是推翻假设都会发布。

GEO 方法论如何让 ChatGPT 在回答中主动提到你的品牌

ChatGPT 的品牌提及率仅 0.59%,是所有主流 AI 中最难攻的平台。本文说明它的信源结构、为什么品牌词策略在这里行不通,以及中小企业唯一现实的切入路径。

GEO 方法论第三方媒体投放在 GEO 中的作用与投放清单

先讲不该买什么:Google 已明确点名'追求不真实的提及'无效且有反制系统。本文区分'买提及'与'赢得报道',给出中英双市场的媒体优先级和真实的成本预期。