# 检索层正在被重写:Mistral Agentic Search 的三倍准确率,对"内容最小单位"意味着什么
我们在 8 月 4 日发过一篇《Agentic RAG 时代,「一篇文章被引用」的逻辑变了》,核心判断是:AI 检索正在从"搜一次、答一次"变成多步循环,优化的最小单位从"一个关键词对应一个页面"变成"一个主题对应一整簇内容"。
那篇文章当时的问题是——没有硬数据。它建立在架构趋势的观察上,而不是可量化的基准。
2026 年 8 月 19 日到 20 日之间,这个缺口被补上了。而且不是一家。
一、同期三条独立证据
证据一:Mistral 发布 Agentic Search(2026 年 8 月 19–20 日)
Mistral 官方将 Agentic Search 定义为一个"检索层",让 AI 系统能够在最复杂的文档内部导航、阅读并验证信息。它在企业已有的搜索索引之上构建,向模型暴露五个工具:search、open、navigate、read、grep。
官方公布的基准数据:
| 基准 | 传统检索 | Agentic Search | 变化 |
|---|---|---|---|
| FinanceBench(财报文件正确率) | 26.7% | 86% | 约 3.2 倍 |
| OfficeQA Pro(表格密集、多文档) | 6.3% | 51.9% | +45.6 个百分点 |
| p90 延迟 | — | — | 最多降低 39.6% |
| token 消耗 | — | — | 减少约三分之一 |
交付方式上,它通过 Mistral Search Toolkit 提供,也内置在 Studio 和 Vibe 的 Libraries 中;检索工具可通过 MCP 暴露给 agent;索引可用 Vespa + Docker 自托管,也可走托管后端。
证据二:微软的 AgenticRAG 论文
微软发表的 AgenticRAG 论文描述了一个几乎相同的思路:在企业已有搜索基础设施之上加一层轻量 harness,给推理模型配备 search、find、open、summarize 四个工具,让模型自主迭代检索、在文档内部导航、分析证据。
论文报告的结果:BRIGHT 上 recall@1 达到 49.6%(比最佳嵌入基线高 21.8 个百分点);WixQA 事实性 0.96(相对提升 13%);FinanceBench 答案正确率 92%,距离"直接给模型真实证据"的理论上限只差 2 个百分点。
其中最关键的是消融实验的结论:贡献最大的单一因素是从单次检索转向 agentic 工具调用,带来约 5.9 倍的提升,而多查询检索和文档内导航是在此基础上进一步改善质量与效率。
证据三:Azure AI Search 的 agentic retrieval 已进入正式版
微软 Azure 侧的 agentic retrieval 能力在 2026-04-01 版 REST API 中已经 GA。它的工作方式是:把复杂查询拆解成子查询(query planning),子查询并行执行、可以是关键词/向量/混合检索,每个子查询各自做语义重排,最后合并结果并保留引用。

三条证据的共同点:都不是"把检索做得更准",而是把检索从一次性动作改成一个循环。三家公司、两种交付形态(开源工具包 / 云服务)、一篇同期论文,指向同一个架构方向。
二、五个工具,逐一对应内容侧的要求
抽象的架构判断不好落地。把 Mistral 那五个工具拆开看,每一个都对应一条明确的内容要求。
`search` — 在索引里找
这一层和过去的 RAG 没有本质区别,仍然是嵌入相似度或混合检索决定候选池。你的内容如果连候选池都进不去,后面四个工具再强也用不上。
对应要求: 这仍然是准入条件。抓取可达性、正文可读性(不依赖 JS 渲染)、语义清晰度依然是第一道关。Search Engine Land 在 8 月 19 日恰好也发了一篇提醒 JavaScript 链接会让页面对 AI 搜索不可见——这两条新闻其实说的是同一件事的两端。
`open` — 打开完整文档,而不只是 chunk
传统 RAG 的一个硬伤是:模型只看到被切出来的那个 chunk,看不到它在文档里的位置和上下文。agentic 检索允许模型打开整篇。
对应要求: 页面的整体结构第一次真的会被"看到"。 过去很多 GEO 建议说"把答案前置",其原因是模型只能看到前面一段。当模型能打开整篇时,前置仍然有价值(省 token、降低延迟),但一个结构混乱、答案埋在第 8 屏的页面,不再是必然出局。
`navigate` — 在文档内部跳转
模型可以根据目录、锚点、章节标题决定跳到哪里,而不是线性读完。
对应要求: 这是这次变化里最被低估的一条。长文档的内部导航结构,从"给人看的便利"变成了"给模型用的接口"。 具体到执行:H2/H3 的层级要真实反映内容结构而不是为了塞关键词;长页面应有目录和锚点;章节标题要能独立表意("技术参数"优于"详情")。
`read` — 读取指定区域
模型定位到某个区域后精读该区域。
对应要求: 局部自洽性。一个章节被单独读取时,它的结论要能独立成立——不能出现"如上文所述"这类必须回溯才能理解的表述作为关键信息的载体。
`grep` — 在文档内做精确匹配
这是五个工具里最"反直觉"的一个:在一个嵌入检索主导的时代,精确字符串匹配回来了。
对应要求: 参数、型号、认证编号、规格数字的字面准确和一致,价值被显著抬高了。 嵌入检索对"2024"和"2025"几乎不敏感,grep 完全敏感。对工业品和 B2B 出海企业来说,这是个直接的好消息:你的参数表如果字面规范、术语统一、型号写法在全站一致,它是可 grep 的;如果同一个型号在官网写 XH-200、在 PDF 里写 XH200、在目录页写 XH 200,那三处都不会被同一次 grep 命中。

三、这条新闻改变了什么,没改变什么
改变的:
- "内容最小单位"的判断得到了基准支持。 我们 8 月 4 日的判断——从页面变成主题簇——现在有了 FinanceBench 26.7%→86% 和微软论文 5.9× 消融这两组数字支撑。不再只是趋势观察。
- 长文档的价值上升。 在只能取 chunk 的时代,长文档是劣势(信息被切碎、上下文丢失)。在可以 open + navigate 的时代,一篇结构良好的长文档是一个可以被反复检索的资源,而不是一次性素材。
- 精确字面匹配重新有价值。 这是过去两年 GEO 讨论里几乎没人提的维度。
- 企业内部知识库和对外内容开始遵循同一套规则。 Mistral 和微软的方案都是面向企业内部文档的,但检索层的要求是一样的。你为 AI 搜索做的内容治理,同时在为自己的内部 RAG 做准备。
没改变的:
- 准入条件没变。 进不了候选池,一切免谈。抓取可达、可解析、事实准确,仍然是前提。
- 这些是企业内部检索产品,不是公开 AI 搜索引擎。 Mistral Agentic Search 服务的是企业自己的文档和数据源,不直接决定 ChatGPT 或 Google AI Mode 会不会引用你的官网。把它当作公开搜索引擎的变化来解读,是错的。
- 公开 AI 搜索是否已采用同构架构,我们不知道。 有间接迹象(AI Mode 的 query fan-out、ChatGPT 的多轮检索行为),但没有任何一家公开搜索平台披露过自己的检索层实现。
第 2、3 点是这篇文章里最需要读者注意的边界。我们能说的是"检索层的技术方向正在收敛到 agentic 模式",不能说"ChatGPT 现在就是这么工作的"。
四、可执行清单:六条内容改造
按投入产出排序,前三条对大多数出海站点当期就能做。
1. 全站型号与参数写法统一(1–2 天,高优先级)
建立一份术语与型号规范表,覆盖官网、PDF 目录、产品页、第三方平台的企业主页。同一个实体在所有位置的字面写法必须一致。这是唯一一条"纯执行、零判断、直接对应 grep"的动作。
2. 长页面补目录与锚点(1 天)
超过 2000 字的页面加上锚点目录,H2/H3 层级与实际内容结构对齐。检查每个二级标题能否脱离上下文独立表意。
3. 章节自洽性检查(2–3 天)
随机抽取站内 10 个长页面的中段章节,单独读,判断结论是否成立。如果必须回看前文才能理解,改写。
4. 从"页面"重组为"主题簇"(2–4 周)
围绕一个采购决策主题,把参数、选型、对比、认证、案例组织成互相链接的一组页面,而不是一篇大而全。这条最费力,也最接近 agentic 检索的实际工作方式。
5. 表格结构化(视存量而定)
OfficeQA Pro 那 +45.6 个百分点专门针对表格密集型问题——说明表格此前是检索的重灾区。避免用图片承载参数表,避免跨行跨列合并单元格,表头文字要能独立表意。

6. 内部知识库同步治理(长期)
如果你已经在用或准备用企业内部 RAG,上面五条同样适用。不要为对外内容和对内文档维护两套标准。
边界声明
- 本文引用的 Mistral 基准数据来自 Mistral 官方 2026 年 8 月发布内容,为厂商自测,我们未独立复现,也未见第三方复现。厂商自测基准通常选择对自身有利的任务分布,请据此折扣理解。
- 微软 AgenticRAG 的数据来自其公开论文,同样未经我们独立验证。
- 本文中"对应要求"部分(五个工具与内容改造的映射)是我们基于公开技术描述作出的推断,不是 Mistral 或微软的官方建议。这些推断的逻辑我们已完整写出,读者可自行判断是否成立。
- 我们不知道 ChatGPT、Google AI Mode、Perplexity 的检索层是否采用同构架构。本文不应被理解为对这些平台内部实现的描述。
- 六条内容改造的预估工时来自我们自己的项目经验,实际视存量规模而定。
- 观测不等于平台官方排名。我们不承诺收录、固定排名、流量或收入。
延伸阅读
- 《Agentic RAG 时代,「一篇文章被引用」的逻辑变了》(本文为其补充基准数据)
- 《AI 的引用决策发生在检索阶段:RAG 六环节完整拆解》
- 《产品页 GEO 改造:把参数表变成 AI 可引用的答案》
- 《中外大模型 RAG 架构的三个根本差异:为什么「一稿通发」必然失效》
本文由妙蛙 GEO 研究团队撰写,使用 AI 辅助进行资料整理与语言校对,文中事实、来源和结论均经人工复核。
