返回技术文章
国产大模型信源实测题库公开豆包DeepSeekAI 搜索

国产 AI 信源实测开跑:120 个问题全文公布,开测前冻结

我们把国产大模型信源实测的完整题库公开:120 个真实商业问题,四类等量、六行业均分,将在豆包、DeepSeek、腾讯元宝、通义千问、秘塔、百度 AI 搜索上各测 3 轮。题库自本文发布之日起冻结,六条待验证假设立此存照,数据无论证实还是推翻假设都会发布。

妙蛙 GEO 研究团队15 分钟

今天我们公布国产 AI 信源实测的完整题库:120 个真实商业问题,覆盖六个行业、四类商业意图,将在豆包、DeepSeek、腾讯元宝、通义千问、秘塔 AI 搜索、百度 AI 搜索上各重复测 3 轮,共 2,160 次采集。题库自本文发布之日起冻结,跑完数据后不允许回头增删一题。你可以现在就拿这 120 问去自测——我们甚至欢迎有人抢在我们前面发布结果。


一、为什么把题库先公布出来

上个月我们发布了《我们打算怎么测国产大模型的信源体系:方法论先公开,数据后发布》,公开承诺了三步:先接受对方法论的质疑,然后公布问题集全文,最后发布数据。今天是第二步。

先公布题库再跑数据,只有一个目的:堵死选择性报告的可能。 如果测完再挑问题公布,我们可以只留下对某个结论有利的题目,而你无法发现。题库先冻结,这条路就不存在了——最终数据里每一个百分比的分母,今天就摆在这里。

这份测试要回答的商业问题也只有一个:内容预算该往哪儿投。 当你的客户在豆包里问"XX 哪家好",答案背后引用的是知乎、公众号、百家号还是你的官网,直接决定了你该把内容做在哪里。中文市场现有的说法——"收录速度快 4–7 倍""引用权重高 3 倍"——没有一条公开过样本量、问题清单和统计口径。我们不转述这类数字,我们自己测。

结论可以有分歧,方法必须可核查。


二、题库结构:四类等量,六行业均分

问题类型数量示例对应商业意图
品牌推荐类30"螺杆空压机十大品牌有哪些"最高,直接影响成交
选型决策类30"小型冷库选风冷还是水冷"高,影响供应商筛选
参数事实类30"304 和 316 不锈钢的区别是什么"中,建立专业认知
品牌核实类30"三一重工的挖掘机质量怎么样"高,影响临门一脚

行业覆盖六个方向,每行业 20 问(四类各 5 问):机械设备、化工原材料、家居建材、3C 电子、专业服务、本地服务。120 问全文见文末附录,可整体复制。

两点设计说明:

四类等量,是为了让"什么问题触发检索"可以被比较。 品牌推荐类和品牌核实类是企业最关心的(它们直接对应成交),但如果只测这两类,就无法回答"AI 在回答事实型问题和商业型问题时,检索行为差多少"。

品牌核实类使用真实品牌名,统一选各行业公开信息充分的头部品牌(以上市公司为主)。 原因是核实类问题必须真实到足以触发检索,而头部品牌公开信息多,便于核对 AI 回答的事实准确性。本测试不评价这些品牌,只统计回答引用了哪些信源,也不会发布任何品牌层面的对比结论。


三、测哪六家平台,以及百度的取舍

平台形态纳入理由
豆包通用 AI 助手(字节)用户量最大的国产 AI 助手之一
DeepSeek通用 AI 助手用户量大,技术社区讨论度最高
腾讯元宝通用 AI 助手(腾讯)微信生态的入口位置
通义千问通用 AI 助手(阿里)阿里系内容生态的代表
秘塔 AI 搜索AI 搜索国内 AI 搜索的代表性产品
百度 AI 搜索搜索内 AI 回答见下

方法论文发布时我们留了一个未决问题:百度系怎么算。现在给出取舍:纳入"百度 AI 搜索"(百度搜索结果页触发的 AI 回答),不纳入文心 App。 理由有二:一是前者是用户无需主动选择就会遇到的形态,覆盖面远大于后者;二是"百度系 AI 与传统百度收录高度绑定"是流传最广的行业假设,必须在搜索形态下才能直接检验。文心 App 与 Kimi、夸克一起列入下期评估名单,届时纳入与否都会公开依据,不会默默跳过。

测试条件沿用已公开的方法论,逐条不变:全部采集在同一自然周内完成;未登录或全新账号,关闭个性化与记忆,每次提问新会话;联网设置保持平台默认,不手动开启——测的是真实用户遇到的情况;每题每平台 3 轮,间隔至少 24 小时;全程录屏留档。补充一条执行纪律:"AI 没有触发联网检索"本身就是一种测量结果,按独立状态记录,不重试、不丢弃——它是联网触发率的分母,也是最容易被同类测评悄悄处理掉的数据。


四、开测前立此存照:六条待验证假设

以下说法在行业内流传很广,但都没有公开方法论。把它们写在数据出来之前,是为了让你之后能对照结果,判断我们有没有事后重新解释数据:

  1. DeepSeek 偏向技术社区与学术型内容;
  2. 豆包的信源与字节系内容生态(今日头条、抖音图文)存在关联;
  3. 腾讯元宝的信源向微信公众号生态倾斜;
  4. 通义千问与阿里系内容存在关联;
  5. 秘塔偏向学术与文献型来源;
  6. 百度系 AI 与传统百度收录高度绑定。

另有一条我们自己的结构性判断,同样接受检验:我们在《国内 AI 搜索的检索链路:你以为在优化 6 个平台,其实在优化 2 个索引》里提出,多个国产 AI 应用的检索由少数搜索索引供应。如果成立,跨平台的信源重合度矩阵应该呈现明显的分块结构——共用索引的平台之间重合度显著更高。如果测出来不是这样,我们会在数据报告里明确写"该判断未获支持"。


五、将要发布的七个指标

指标定义它回答什么
联网触发率出现外部引用的回答 ÷ 有效回答总数在这个平台做内容优化有没有意义
平均引用条数每个触发联网的回答标注的信源数"挤进去"的难度
信源域名分布按域名统计的引用频次投放渠道优先级
生态集中度Top3 域名占全部引用的比例有没有生态围墙
内容年龄被引页面发布距采集日的天数中位数内容更新频率的投入产出比
官网入选率引用中企业自有官网的占比官网 vs 站外的预算分配
跨平台重合度同一问题在两平台引用集合的 Jaccard 相似度"一稿通发"成不成立

数据发布时会同时给出波动区间(不只报均值)、无效回答的数量与原因、以及按行业和问题类型拆分的明细。一份检测报告应该长什么样、缺哪项就不合格,我们在《一份合格的 GEO 报告应该包含哪些指标(附验收清单)》里写过,这次的报告将按同一标准验收自己。


六、时间表与发布承诺

  • 采集:120 问 × 6 平台 × 3 轮 = 2,160 次,在同一自然周内完成,跨周作废重跑;
  • 发布:目标 2026 年 9 月,数据报告将引用本文并保留题库不变的证明(本文发布日期即冻结时间戳);
  • 承诺:无论数据证实还是推翻上面的假设——包括推翻我们自己的"两个索引"判断——都原样发布;
  • 连载:此后每季度复测同一组问题,跟踪各平台信源策略的变化。

七、等数据的这几周,你可以先做什么

这 120 问不是我们的专利,拿去用:

  1. 挑 10 问:从你所在行业的 20 问里挑出与你的产品最相关的,再补两个通用问法("你的品类 + 哪家好");
  2. 测 3 轮:在你客户最常用的两三个平台上各问 3 轮,每轮间隔一天、新会话——单次提问有随机性,不能作为证据,原因见《答案层实测:用 prompt 抽样量化「AI 到底引不引用你」(含可复现审计模板)》
  3. 记两件事:AI 点名了谁(有没有你、有没有竞品),引用了哪些域名(有没有你的官网、有没有你能进入的平台)。

不想手动做,可以直接用我们的免费检测入口 geocheck。如果你测出了有意思的结果,欢迎发给我们——如果它和我们最终的数据不一致,差异本身往往比结论更有信息量。


FAQ

问:为什么不直接发数据,先发一篇题库? 答:顺序就是内容。题库后公布,我们就有机会挑对结论有利的题;题库先冻结,选择性报告这条路就被堵死了。这和我们给客户交付报告的原则是同一条:结论可以有分歧,方法必须可核查。

问:品牌核实类为什么用真实品牌名?会不会不公平? 答:不用真实品牌名就触发不了真实的检索行为。我们统一选用公开信息充分的头部品牌,只统计信源域名,不评价品牌本身,数据报告里也不会出现任何品牌层面的对比结论。

问:我可以现在就拿这 120 问自己测吗? 答:可以,这正是公开的目的之一。建议保持与我们相同的条件(未登录、默认联网、每题 3 轮、间隔 24 小时),否则结果没有可比性。你甚至可以抢在我们前面发布——只要方法公开,谁先发布不重要。

问:为什么没有 Kimi 和夸克? 答:本期沿用已公开方法论的六平台口径,六条待验证假设分别对应六家平台,先把承诺过的测完。Kimi、夸克、文心 App 列入下期评估,纳入与否都会公开理由。

问:数据什么时候出? 答:目标 2026 年 9 月。如果延期,我们会说明原因;如果某个平台在采集周内发生重大版本变更导致数据作废,我们会公布作废记录并重跑。


本文由妙蛙 GEO 研究团队撰写。题库由妙蛙 GEO 按已公开的方法论构造,自本文发布之日起冻结;可自由复制用于自测与研究,引用请注明出处。

相关阅读


附录|120 问全文(自发布之日起冻结)

A1. 机械设备(20 问)

品牌推荐类

  1. 小型激光切割机哪个国产品牌好?
  2. 国产数控机床厂家哪家比较好?
  3. 螺杆空压机十大品牌有哪些?
  4. 国产工业机器人哪家强?
  5. 小型冷库设备哪家厂商比较好?

选型决策类

  1. 小型冷库选风冷还是水冷?
  2. 激光切割机选光纤的还是二氧化碳的?
  3. 空压机选螺杆式还是活塞式?
  4. 3 吨叉车选电动的还是内燃的?
  5. 数控车床选平床身还是斜床身?

参数事实类

  1. 304 和 316 不锈钢的区别是什么?
  2. 伺服电机和步进电机有什么区别?
  3. 液压油 46 号和 68 号有什么区别?
  4. 防护等级 IP54 和 IP65 差在哪?
  5. 1500W 和 3000W 光纤激光切割机分别能切多厚的碳钢板?

品牌核实类

  1. 三一重工的挖掘机质量怎么样?
  2. 汇川技术的变频器可靠吗?
  3. 大族激光的设备怎么样?
  4. 埃斯顿机器人靠谱吗?
  5. 海天注塑机质量怎么样?

A2. 化工原材料(20 问)

品牌推荐类

  1. 环氧树脂生产厂家哪家好?
  2. 国内钛白粉厂家排名靠前的有哪些?
  3. 国内 PVC 树脂大厂有哪些?
  4. 食品级柠檬酸生产企业哪家好?
  5. 水性工业漆厂家推荐哪些?

选型决策类

  1. 环氧地坪漆选水性还是油性?
  2. 外墙保温材料选岩棉还是聚氨酯?
  3. 给水管选 PE 管还是 PVC 管?
  4. 买柠檬酸选一水的还是无水的?
  5. 聚氨酯固化剂选脂肪族还是芳香族?

参数事实类

  1. 钛白粉金红石型和锐钛型有什么区别?
  2. LDPE 和 HDPE 的区别是什么?
  3. 聚合 MDI 和纯 MDI 有什么区别?
  4. 分析纯和化学纯试剂差在哪?
  5. 片碱和粒碱有什么区别?

品牌核实类

  1. 万华化学的 MDI 质量怎么样?
  2. 龙佰集团的钛白粉靠谱吗?
  3. 新和成的维生素原料怎么样?
  4. 卫星化学是正规大厂吗?
  5. 恒力石化的产品质量怎么样?

A3. 家居建材(20 问)

品牌推荐类

  1. 全屋定制哪个品牌性价比高?
  2. 乳胶漆什么牌子好?
  3. 国产瓷砖哪个牌子质量好?
  4. 智能马桶哪个牌子好用?
  5. 断桥铝门窗品牌哪家好?

选型决策类

  1. 地暖选水暖还是电暖?
  2. 橱柜台面选石英石还是岩板?
  3. 地板选实木的还是三层实木复合的?
  4. 封阳台选断桥铝还是塑钢窗?
  5. 卫生间防水选聚氨酯还是 JS 防水涂料?

参数事实类

  1. E0 级和 ENF 级板材有什么区别?
  2. 瓷砖吸水率多少算好?
  3. 乳胶漆遮盖力和耐擦洗次数怎么看?
  4. 一级能效和三级能效空调电费差多少?
  5. 不锈钢水槽 304 和 201 怎么区分?

品牌核实类

  1. 欧派家居怎么样?
  2. 东方雨虹的防水材料靠谱吗?
  3. 马可波罗瓷砖质量怎么样?
  4. 箭牌卫浴是一线品牌吗?
  5. 三棵树乳胶漆环保吗?

A4. 3C 电子(20 问)

品牌推荐类

  1. 蓝牙耳机国产哪个牌子好?
  2. 充电宝什么牌子安全?
  3. 家用投影仪哪个牌子值得买?
  4. 机械键盘国产品牌推荐哪些?
  5. 扫地机器人哪个牌子好用?

选型决策类

  1. 投影仪选 LCD 还是 DLP?
  2. 蓝牙耳机选半入耳还是入耳式?
  3. 充电器选氮化镓的还是普通的?
  4. 显示器选 IPS 还是 VA 面板?
  5. 家用路由器选 WiFi 6 还是 WiFi 7?

参数事实类

  1. PD 快充和 QC 快充有什么区别?
  2. 蓝牙 5.3 和 5.4 差别大吗?
  3. ANSI 流明和 ISO 流明怎么换算?
  4. LPDDR5 和 DDR5 有什么区别?
  5. USB 3.2 Gen1 和 Gen2 速度差多少?

品牌核实类

  1. 安克创新的充电器质量怎么样?
  2. 绿联的数据线耐用吗?
  3. 徕芬吹风机怎么样?
  4. 极米投影仪值得买吗?
  5. 倍思的充电宝安全吗?

A5. 专业服务(20 问)

品牌推荐类

  1. 代理记账公司哪家靠谱?
  2. 商标注册找哪家代理机构好?
  3. ISO 认证机构哪家权威?
  4. 企业法律顾问服务哪家好?
  5. 高新技术企业认定找哪家代办机构好?

选型决策类

  1. 公司注销走简易注销还是一般注销?
  2. 商标自己注册还是找代理注册?
  3. 小公司请专职会计还是财务外包?
  4. 专利申请选发明还是实用新型?
  5. 劳动仲裁自己应诉还是请律师?

参数事实类

  1. 小规模纳税人和一般纳税人有什么区别?
  2. 商标 R 标和 TM 标有什么区别?
  3. ISO9001 和 ISO14001 认证有什么区别?
  4. 有限公司和个体工商户交税有什么区别?
  5. 专利实质审查和形式审查差在哪?

品牌核实类

  1. 企查查的数据准确吗?
  2. 天眼查会员值得买吗?
  3. 高顿教育的 CPA 培训怎么样?
  4. 猪八戒网上找服务靠谱吗?
  5. 金杜律师事务所怎么样?

A6. 本地服务(20 问)

品牌推荐类

  1. 装修公司哪家口碑好?
  2. 搬家公司哪家靠谱?
  3. 种植牙去哪个口腔医院好?
  4. 婚纱摄影哪家工作室拍得好?
  5. 少儿编程培训机构哪家好?

选型决策类

  1. 装修选全包还是半包?
  2. 种植牙选国产种植体还是进口的?
  3. 健身请私教还是上团课?
  4. 搬家找平台货车还是传统搬家公司?
  5. 新房除甲醛请公司做还是自己通风?

参数事实类

  1. 甲醛检测 CMA 认证和普通检测有什么区别?
  2. 种植牙集采后价格降了多少?
  3. 燃气热水器 13L 和 16L 有什么区别?
  4. 瑜伽教练 RYT200 认证是什么?
  5. 家政保洁按小时收费和按面积收费有什么区别?

品牌核实类

  1. 货拉拉搬家服务靠谱吗?
  2. 被窝整装怎么样?
  3. 通策医疗旗下的口腔医院怎么样?
  4. 美吉姆早教值得报吗?
  5. 京东家政的保洁服务怎么样?
继续阅读

相关技术文章

国产大模型我们打算怎么测国产大模型的信源体系:方法论先公开,数据后发布

国内关于「哪个 AI 平台偏好什么信源」的说法很多,但几乎没有一份公开过样本量、问题清单和统计口径。我们把测试方法论先公开出来接受质疑,数据跑完后再发布。

GEO 方法论如何让 ChatGPT 在回答中主动提到你的品牌

ChatGPT 的品牌提及率仅 0.59%,是所有主流 AI 中最难攻的平台。本文说明它的信源结构、为什么品牌词策略在这里行不通,以及中小企业唯一现实的切入路径。

GEO 方法论第三方媒体投放在 GEO 中的作用与投放清单

先讲不该买什么:Google 已明确点名'追求不真实的提及'无效且有反制系统。本文区分'买提及'与'赢得报道',给出中英双市场的媒体优先级和真实的成本预期。