本文所有结论均标注原始论文出处,可自行核查。
关于"AI 凭什么挑信源",学术界已经有了明确答案,而且其中不少结论和 GEO 行业流传的说法正好相反。 国内讨论 GEO 的内容里,大量数据没有可溯源的方法论。本文只梳理有公开论文支撑的结论,每条附出处。
一、关键词密度基本无效,"证据性"才有效
出处:Aggarwal, Murahari, Rajpurohit, Kalyan, Narasimhan, Deshpande. GEO: Generative Engine Optimization. KDD 2024(arXiv:2311.09735)
这是 GEO 这个词的源头论文,也是第一项大规模验证"内容改造能否提升 AI 引用率"的研究。团队构建了包含约 1 万条查询的 GEO-bench 基准,测试了九种内容改造策略。
结论分两半:
无效的——关键词密度等经典 SEO 信号,对被引用概率的影响微乎其微。在生成式引擎里堆关键词是白费力气。
有效的——集中在增强内容"证据性"的几类改动:补充统计数据、标注信息来源、加入权威引述、优化行文流畅度、采用权威语气。表现最好的几种策略可带来最高约 40% 的可见度提升,其中"补充统计数据"与"流畅度优化"的组合效果最强。
对企业的含义:把"我们品质优良、交货及时"改写成"2025 年准时交付率 98.2%(第三方物流数据)",这一个动作的价值高过一整轮关键词布局。
二、排名靠后的网站,从 GEO 中获益更大
出处:同上(Aggarwal 等,KDD 2024)
论文中一个被反复引用的发现:低排名网站从 GEO 改造中获得的可见度提升,显著高于高排名网站。
原因不难理解。传统搜索里,第一名拿走绝大部分点击,第十名几乎没有流量;而生成式引擎只要把你放进那几条候选来源,你和其他来源在答案里的分量差距就小得多。
对企业的含义:这是中小企业在 AI 搜索时代唯一的结构性红利。在传统 SEO 里你可能永远打不过行业头部,但在 AI 回答里,你有机会和他们并列出现。这个窗口不会一直开着。
三、模型看重相关性,而非人类看重的权威线索
出处:Wan, Wallace, Klein. What Evidence Do Language Models Find Convincing? ACL 2024(arXiv:2402.11782)
UC Berkeley 团队构建了 ConflictingQA 数据集:把有争议的问题(比如"阿斯巴甜是否致癌")配上立场相反的真实网页,观察模型会被哪一方说服。
核心发现:模型高度依赖网页与问题的相关性,而在很大程度上忽略了人类认为重要的风格特征——比如文中有没有科学文献引用、语气是否中立客观。研究还发现,仅仅在页面开头加一句点明"以下内容是在回答这个问题",就能显著提升该页面的胜出率;而多数模仿人类判断标准的风格改动,效果是中性甚至负面的。
对企业的含义:这条和第一条并不矛盾——数据和引述之所以有效,是因为它们提升了内容的"信息密度和可摘录性",而不是因为它们让内容"看起来权威"。别把力气花在装权威上,花在"更对题"上。
具体动作:每个页面开头明确写出它回答的是哪个问题,用客户的原话,不用行业黑话。
四、被引用 ≠ 被正确引用
出处:Liu, Zhang, Liang. Evaluating Verifiability in Generative Search Engines. EMNLP Findings 2023(arXiv:2304.09848)
Stanford 团队人工审计了四个当时主流的生成式搜索引擎(Bing Chat、NeevaAI、perplexity.ai、YouChat),结果是:
- 平均只有 51.5% 的生成语句,能被其标注的引用完全支撑
- 只有 74.5% 的引用,真正支持了它所对应的那句话
对企业的含义:两层。第一,你的内容可能已经在影响 AI 的回答,只是没有拿到署名——所以只统计"品牌提及次数"会系统性低估实际影响。第二,AI 转述你的品牌信息时出错是常态而非意外,参数写错、把竞品的问题安到你头上,都属于剩下那部分。品牌信息纠错应该是常规动作。
五、被引用的内容,风格上更"像 AI 自己写的"
出处:2025 年多项生成式搜索引擎引用行为的实证研究(Ma 等)
这些研究发现,被引用的信源相比传统搜索排名结果,呈现出明显的共性:语义上彼此更相似、困惑度更低、可读性更高、结构更正式。研究者的解释是,模型偏好那些与自身生成模式相契合的内容。
对企业的含义:这条容易被误读成"用 AI 写文章更容易被引用"。更准确的理解是:句式规整、逻辑显式、术语一致的内容更容易被采用。 那些长句套长句、指代不清、一段讲三件事的中文写作,在这里是劣势。
具体动作:一句话一个意思;避免"其""该""此类"这种需要回溯上下文才能理解的指代;同一概念全文用同一个说法,别一会儿"AI 可见度"一会儿"AI 曝光度"。
六、位置偏好与格式效应真实存在
出处:同上(2025 年多项引用行为研究)
一致的发现是:文档中靠前位置的内容、结构化的 HTML、明确的统计数字、格式一致的引用标注,都会提高被引用的概率。
对企业的含义:这是"开头就给答案"这条写作铁律的实证依据。上下文窗口有限,长文档会被截断或压缩,靠后的内容可能物理上就没进模型视野。
具体动作:核心答案放前 200 字;用真表格而不是图片表格;FAQ 上移。
七、头部曝光被放大,长尾更难出头
出处:同上(2025 年多项引用行为研究)
研究观察到引用面板存在头部/长尾的曝光放大效应:已经知名的内容生产者,可见度被系统性抬高。
对企业的含义:这条要和第二条一起读,两者并不冲突。第二条说的是"进入候选集后差距被压缩",这条说的是"进入候选集本身对头部更容易"。合起来的策略结论是:不要在宽泛的大词上正面硬刚,去做细分场景的问题。 在"工业阀门厂家推荐"上你打不过头部,在"高温蒸汽管道用截止阀选型注意事项"上你有机会。
八、不同引擎的引用集合几乎不重叠
出处:2026 年针对多个生成式搜索引擎的对比审计
现有分析指出,不同系统采用不同的评估标准,同一个问题在不同平台得到的引用集合可能完全不重叠;在一个引擎里的可见度,无法迁移到另一个引擎。部分系统还高度依赖模型自身的参数化知识,有分析报告称某个模型高达 82% 的回答完全没有引用任何外部网站。
<!-- 编辑注:本节数据来自二手汇总(dailygeoinsights.com, 2026-05),发布前请核对原始审计报告,或替换为我们自己的实测数据。 -->
对企业的含义:这是"多平台分别优化"的最强论据,也是判断服务商是否专业的一个测试题——如果对方承诺"一套内容覆盖所有 AI 平台",可以直接排除。
九、部分 AI 引擎会引用传统搜索排名极靠后的域名
出处:同上(2026 年多引擎对比审计)
有分析显示,部分 LLM 驱动的搜索引擎所引用的域名,在传统搜索引擎中的排名位置要靠后得多;低流量域名被引用的比例显著高于传统搜索。
<!-- 编辑注:同上,二手来源,发布前需核实。 -->
对企业的含义:这条是第二条的延伸证据。你的站点权重不高、外链不多,并不必然意味着在 AI 回答里没戏。决定性因素回到第三条——内容和问题的匹配度。
把九条结论压成三句话
- 别装权威,去对题。 相关性权重高于风格线索。
- 别堆关键词,去加数据。 具体数字、来源标注、权威引述才是有效改动。
- 别指望一稿通发。 各平台引用集合差异极大,必须分别优化。
具体到怎么改,见我们的另一篇:从 RAG 研究到 12 条内容改写规则。
常见问题
Q1:这些研究都是基于英文模型的,对国内平台适用吗? 机制层面(相关性优先、位置偏好、结构化偏好)大概率通用,因为它们源于 RAG 架构本身而非语言。但具体的信源池、收录范围和排序权重差异巨大,不能直接套用。国内平台需要独立实测。
Q2:Princeton 那篇论文说的 40% 提升,是稳定可复现的吗? 需要谨慎理解。该数字是在特定基准和模拟引擎环境下的相对提升,不等于任何网站做同样改造都能获得 40% 增长。它的价值在于证明了"哪些改动方向有效、哪些无效",而不是提供一个可承诺的 KPI。任何拿这个数字向你承诺效果的服务商,都值得警惕。
Q3:为什么国内很少见到这类研究? 国内公开的 AI 引用行为研究确实稀少,中文网络上流传的多数"信源偏好数据"没有公开方法论和样本量,无法验证。这也是我们自己做实测报告的原因。
Q4:论文结论会不会很快过时? 部分会。检索架构正在向多步循环(Agentic RAG)演进,具体策略的有效性会变化。但"相关性优先""结构化优先""证据性优先"这三条源自架构本身,短期内不会失效。
