你在豆包、DeepSeek、元宝、夸克上看到的"信源偏好",很大一部分不是模型决定的,而是它们背后接的那个搜索索引决定的。 国内至少有一家搜索 API 供应商同时服务着多个头部 AI 应用——这意味着市面上"针对 6 个国产大模型分别优化"的服务方案,可能在描述一个并不存在的工作量。
这篇文章不写"某平台的收录逻辑",因为没有人有可核查的证据说得清那个东西。它只写一件可以查证的事:每个平台的答案是从哪个索引里取出来的。
一、先说证据等级(这一节请不要跳过)
海外平台的拆解有据可依:Google 有官方指南,OpenAI、Perplexity 有爬虫文档,Ahrefs、Moz、SE Ranking 有几十万到几百万量级的公开研究。
国内一样都没有。
中文互联网上关于国产 AI 平台"信源偏好"的内容,我们做过一轮系统检索,结论是:绝大多数出自 GEO 服务商的营销稿,无方法论、无样本量,且存在明显的引用错配——例如把普林斯顿 GEO 论文的结论说成"采用结构化数据标记的内容 AI 引用率提升 37%–40%"(该论文测的是文本改写策略,不是 schema),再与"某公司官方数据:可见性提升 45%–60%"并列引用。
所以本文对每条事实标注证据等级:
- A 级:多方独立来源一致,或平台官方公开表述
- B 级:厂商自述或单一媒体报道,方向可信但数值待核
- C 级:合理推断,无直接证据
看到 C 级就当假设用,不要写进给客户的方案里。
二、检索链路图
| 平台 | 生成模型 | 检索来源 | 等级 |
|---|---|---|---|
| DeepSeek(C 端应用) | DeepSeek 自研 | 博查 AI 的 Search API | B |
| 腾讯元宝 | 混元 / DeepSeek-R1 双模型 | 微信搜一搜、搜狗搜索、腾讯新闻,并优先覆盖公众号与视频号 | A |
| 豆包 | 字节自研 | 字节内容生态(抖音、今日头条、西瓜)+ 公开网页 | B |
| 夸克 AI 搜索 | 通义系 | 阿里/夸克自有搜索索引 | B |
| 百度 AI 搜索 | 文心 | 百度索引 | A |
| 秘塔 AI 搜索 | 自研 | 自建索引 | B |
| Kimi | 月之暗面自研 | 未公开 | — |
关于博查这一条,要多说两句
博查是一家专为 AI 应用做搜索的公司,提供 Web Search API、Semantic Reranker API 等服务。其在阿里云云市场的商品页自述为"DeepSeek 的官方搜索引擎",并称已服务 20000+ 企业用户、日调用量超 3000 万次,同时是腾讯、字节、阿里等厂商的推荐搜索服务。36 氪的报道则称国内超过 60% 的 AI 应用(包括 DeepSeek 的 C 端应用)的联网搜索能力通过接入博查的 Search API 实现。
这两条都是厂商侧或转述口径,我们没有找到独立的第三方核实,因此标为 B 级。 但即便打个折,方向是清楚的:国内 AI 应用的联网检索存在明显的供应商集中现象。
如果这一点成立,推论有三条:
- 需要优化的索引数量,远少于需要优化的平台数量。 同一个 Search API 背后的排序变化,会同时改变多个平台的答案。
- 单点风险变成了可见度风险。 你的内容在某个搜索 API 的索引里表现如何,可能比在任何单一 AI 产品里的表现更重要。
- "50+ 大模型全域适配"这类卖点需要重新审视。 如果底层只有两三个索引,那"适配 50 个模型"描述的是同一件事被数了 50 遍。
三、与海外 GEO 最大的结构性差异:站外内容不在你的服务器上
海外的 GEO 有一个隐含前提——你想被引用的内容托管在你自己的域名下,因此 robots.txt 和服务器日志是有效的控制点与观测点。
国内不是这样。
元宝优先调用的是微信公众号内容。腾讯方面公开表述过,元宝的 AI 搜索来源除公众号外还整合了搜狗、腾讯新闻等,并会标注来源链接。豆包倚重的是抖音与今日头条生态。这些内容都不在你的服务器上:
- 你的 robots.txt 管不到公众号文章
- 你的服务器日志看不到任何抓取记录
- 你无法用 UA + IP 验证爬虫真伪
- 你也拿不到任何一方数据(国内没有任何平台提供类似 Bing AI Performance 那样的站长引用报告)
因此在国内做可见度,官网的权重结构性地低于海外场景,而账号矩阵的权重结构性地高。 这不是策略选择,是链路决定的。
对同时做内外贸的企业,这意味着两套完全不同的工作方式,不能用一份方案覆盖。
四、可观测层:还能查什么
虽然生态内容管不到,网页侧的爬虫仍然可控可测:
| User-agent | 归属 | 说明 |
|---|---|---|
Bytespider | 字节跳动 | 也用于头条搜索,遵守 robots 协议,可用 robots.txt 屏蔽 |
Baiduspider | 百度 | 百度索引的准入前提 |
PetalBot | 华为 Petal | 官方说明其为 Petal 搜索建立索引,并驱动华为助手与 AI 搜索的内容推荐;遵守 robots 协议 |
外贸企业最常见的失分点:为了防采集,在 CDN 或 WAF 层做了宽泛的 UA 拦截,把这几个一起封了。检查方法和海外一样——打开 yourdomain.com/robots.txt,再翻一遍 WAF 规则。
需要注意的是,国内厂商公开的爬虫文档远不如 OpenAI、Perplexity 完整,多数没有发布可验证的 IP 段。这意味着 UA 伪造无法排除,日志里的抓取量只能作为参考,不能当作准确指标。
五、我们目前不知道,而且没人知道的
- 各平台的信源类型分布。 没有任何带方法论的公开研究。
- 中文提问与英文提问是否命中完全不同的信源。 无研究。
- B2B 采购类问题在国内平台上的引用模式。 无研究。
- 博查等搜索 API 的索引覆盖范围与排序策略。 完全不公开。
这四项正是我们下一批原创实测的选题。 在拿到自己的数据之前,我们不会对国内平台的"信源偏好"给出任何数值化结论——市面上给了的那些,请去问他们要样本量。
六、2026 年正在发生的变化:从"被检索"到"被调用"
写这篇文章时,国内的竞争重心正在从"AI 检索什么内容"移向"AI 能调用什么服务"。三条可核查的线索:
- 微信原生 AI 智能体。 据报道,腾讯正在为一款嵌入微信的 AI 智能体做收尾测试,入口拟定为微信主界面右滑。其技术前提是微信已有的数百万个小程序——它们本质上是一套覆盖上百个细分行业的标准化接口,Agent 可直接调用,无需像 GUI 方案那样识别屏幕元素。
- 豆包走的是屏幕模拟路线(识别界面元素模拟用户操作),千问走的是接口打通路线(与高德、蚂蚁支付、飞猪、饿了么等阿里系场景深度整合)。
- 用户规模对比(QuestMobile,2026 年 3 月):豆包月活 3.45 亿,千问约 1.66 亿,元宝独立 App 5735 万。
对企业的含义:在"被引用"之外,一个新的可见度维度正在形成——你的服务有没有以可被程序化调用的形式存在。小程序、开放接口、结构化的商品与库存数据,可能会在未来 12–24 个月内变得比一篇优化过的文章更重要。
这一段是趋势判断,不是已验证结论,按 C 级处理。但它值得现在就开始占位。
七、可执行清单
- 检查 robots.txt 与 WAF,确认没有误封
Bytespider、Baiduspider、PetalBot - 把"账号矩阵"当基础设施而非市场活动:公众号(元宝)、头条号/抖音(豆包)、百家号(百度 AI)是国内三条主要通道
- 官网继续做,但预期要调低——国内链路里它不是主战场
- 不要为"50+ 大模型适配"付费,先问对方底层接了几个索引
- 任何声称国内平台"收录逻辑"或给出提升百分比的方案,索要样本量、时间窗口和查询集;给不出就是营销稿
- 开始盘点自己的服务能否被结构化调用(小程序、商品接口、库存数据),这是下一轮的入场券
FAQ
国内做 GEO 和海外做 GEO 是一回事吗? 不是。海外的可控点在自己的域名(robots.txt、服务器日志、一方报告),国内的关键内容在平台生态内(公众号、头条、抖音),这些都不在你的服务器上,也没有任何平台提供站长侧的引用数据。
针对每个国产大模型分别优化有必要吗? 证据显示国内 AI 应用的联网检索存在明显的供应商集中现象,多个平台可能共享同一个搜索索引。在拿到独立验证之前,对"逐个平台优化"的报价应保持怀疑。
为什么这篇文章不给具体的引用份额数字? 因为没有可核查的来源。给出数字很容易,给出能被验证的数字目前做不到。我们选择说不知道,并计划用自己的实测来填。
国内平台有类似 Search Console 的官方报告吗? 截至本文发布,没有。这是国内 GEO 与海外最大的能力差距之一。
证据等级说明见第一节。本文 B、C 级结论需在引用前自行核实。下次复核计划:2026 年 11 月。
