一篇关于大模型思维链的论文,最先以一个极具传播力的故事进入公众视野:只需把旗舰模型返回的加密推理块交给同一家公司的较弱模型,就可能恢复出原本不对用户展示的推理文本。
这个故事很容易被压缩成几个刺激的词:两次 API 调用、低价模型“解码”旗舰模型、思维链泄露、蒸馏出现物证。
但如果站在企业和品牌做 GEO 的角度,最值得注意的并不是如何“偷看模型”,而是另一件更基础的事:
用户问题和最终答案之间,存在一条很长、而且部分不可见的决策链。最终答案只是链路末端;模型给出的解释,也未必是对整条链路的忠实复盘。
这意味着,今后的 GEO 不能只做“问一次、看排名、数提及”。真正有价值的研究对象,应当从答案层转向决策过程,从相关性观察转向可重复的因果干预。
我们更愿意把它叫作:LLM Decision Causality,大模型决策因果研究。
一、先把热点标题拆开:被恢复的是推理文本,不是已经判定的“蒸馏实锤”
论文名为《Stealing Reasoning Traces from Proprietary LLM APIs》,共 116 页,于 2026 年 8 月 10 日提交至 arXiv。截至本文写作时,它仍是一篇预印本。
论文研究的核心,是部分模型 API 如何保存连续推理状态。
推理模型在多轮任务中可能需要继续使用前一轮状态。为了减少服务端保存压力,并适应零数据保留等使用方式,部分 API 会把推理状态以加密块的形式交给客户端;下一次请求时,客户端再把这个不透明字段原样传回。
研究者发现,在其测试的特定 API 版本中,这些加密块没有被严格限制在原会话、原用户和原模型内。同一厂商生态中的兼容模型可能读取它们。研究者于是让更弱、限制较少的模型充当“模糊解码器”,转录强模型生成的加密推理。
论文在 Anthropic、OpenAI 和 Google 的模型体系中展示了这条攻击路径。
但传播过程中,有三件事经常被混在一起。
| 传播中的说法 | 论文直接支持什么 | 不能据此断言什么 |
|---|---|---|
| “两步完成蒸馏” | 两步式请求可以形成 reasoning extraction 通道,恢复的数据可能被用于蒸馏 | 两次调用本身不是完成模型训练,也不能证明某个外部模型已经蒸馏了另一家模型 |
| “完整大脑被逐 Token 打开” | 在 120 个 Codeforces 输入上,恢复文本长度与 API 报告的 thinking-token 数量多数紧密对应 | 研究者没有官方 plaintext ground truth,无法验证每个 Token 都与原始推理完全一致 |
| “最弱模型是万能解码器” | 研究者在每家体系内找到较弱的兼容模型作为 fuzzy decoder | 任意小模型都能读取任意强模型,或不同厂商之间可以互相解码 |
| “蒸馏悬案已有定论” | 论文提供了相似续写、前缀影响等值得继续调查的现象 | 论文没有对具体模型作出训练数据来源或侵权归因结论 |
尤其值得注意的是,论文讨论开放模型是否使用专有模型推理做过蒸馏时,附录开头先写下了明确免责声明:这些实验不能因果证明蒸馏。研究者把 Opus 恢复推理的前 1% 填入 Kimi-K3 的推理开头,在 30 道 Humanity's Last Exam 问题中,有 29 道的可见答案与 Opus 答案出现更高的 n-gram 重合;STEM 与非 STEM 两组的平均增量分别约为 0.15 和 0.09。16-token 续写实验也显示模型间存在数量级差异。
这些结果确实值得进一步调查,但还不是训练数据来源的“指纹鉴定”。作者列出的限制包括:样本小且偏向基准题、推理来自可能有误差的模糊恢复、不同模型的服务配置不受研究者控制。换句话说,它观察到了特定干预下的行为兼容性,却没有排除提示敏感性、模型架构相似、共同训练语料或服务配置等其他解释。
这里最重要的措辞差别是:论文得到的是高可信度的 reasoning reconstruction,不是有官方明文可逐字核对的“绝对真实思维链”。
研究者用 API 计费所报告的思考 Token 总数验证恢复长度,这是有价值的证据;但“字数接近”不能证明每一个词都相同,更不能证明这些文本就是模型全部且忠实的因果计算。
论文还记录了真实安全后果:研究团队从公开 Agent 轨迹中重建了 315,320 个推理块,并报告发现 367 项个人身份信息和 182 项凭证。论文完成负责任披露后,相关厂商确认收到了报告;作者表示,随后已无法继续用相同方式发动攻击。
所以,这不是一条企业可以长期利用的“GEO 技巧”。对企业最直接的动作反而是安全治理:不要因为字段是加密或不可读的,就把原始 Agent 日志、API transcript 和 opaque reasoning fields 直接放进公开仓库。

二、论文真正打开的,不是排名公式,而是最终答案之前的过程层
论文开篇有一个对 GEO 很关键的描述:隐藏推理可能包含中间假设、工具输出、用户数据和上下文秘密,而且信息密度通常高于最终输出。
这句话的重要性,不在于它泄露了某个“关键词公式”,而在于它提醒我们:最终回答会压平中间过程。
论文附录记录了一个 GPT-5.3 Codex 的长任务。模型先尝试直接解决一道数学题;失败后开始搜索;没有找到答案,又在很长的轨迹后发现题目网站存在评分接口,于是考虑把它当作答案验证器;遇到 CAPTCHA 后尝试处理阻碍,最终又回到数学推导并完成解题。
如果只看最后答案,读者不会知道它经历过搜索失败、策略改变和工具选择。
但这个案例也必须带着限制阅读。它只是一个轨迹,而且 system prompt 明确要求模型保持自主和持续,developer message 又开启网络并禁止请求人工批准。也就是说,它证明的是:在这类工具和指令条件下,这种行为可以发生。 它不能证明所有 AI 搜索都会按照相同方式行动,更不能给出商业查询中的搜索规律。
论文里另一个更值得 GEO 从业者警惕的现象,是 summary unfaithfulness。
在一个 AIME 数学题案例中,恢复文本一开始便出现了“这是已知题,答案是 60”的信息,之后模型才展开推导;而提供给用户的 reasoning summary 没有呈现这个顺序。作者认为,这与记忆或数据污染的解释相符,但也明确表示无法识别答案究竟从哪里获得。
它至少说明两件事:
第一,模型展示给用户的“思考摘要”可能省略关键过程。
第二,看起来逻辑完整的解释,也可能是在答案已经出现之后补出来的合理化叙述。
这对 GEO 有一个非常直接的提醒。企业询问模型“为什么推荐品牌 A”,得到的答案可能是:产品丰富、价格合适、评价良好。但这段解释不能自动证明模型真正遵循了“评价加价格加产品”的计算路径。实际影响因素还可能包括模型已有记忆、搜索结果顺序、工具返回、上下文位置、系统指令和品牌先验。
因此:
看见更多过程,不等于已经找到真实因果;看见模型解释,更不等于拿到了推荐算法。
三、这篇论文没有回答五个 GEO 最想知道的问题
完整审计论文后,可以确认它没有系统研究以下问题:
- 用户问题会被改写成哪些搜索词;
- 哪些网页进入完整候选集;
- 为什么来源 A 被放入上下文,而来源 B 被排除;
- 为什么某个来源被采用却没有引用,或者被引用却没有改变推荐;
- 域名权威、第三方评价、品牌知名度分别占多大权重。
论文也没有搭建传统意义上的 RAG 实验:没有围绕 embedding、vector database、top-k retrieval、reranking、context injection 和 generation 做系统对照。
所以,从这篇论文得不出“ChatGPT 会把某个商业问题改写成哪几组词”,也得不出“Reddit、品牌官网或行业媒体的固定权重”。如果有人把这篇安全论文包装成“GEO 排名算法已经被破解”,那是把研究对象换掉了。
它与 GEO 的连接,是研究单位发生了变化:
过去我们常把一个查询记成:
Prompt → Answer → Mention → Rank → Citation
今后至少要拆成:
抓取资格 → 索引与新鲜度 → 搜索触发与查询形成 → 候选召回 → 上下文分配 → 证据采用 → 引用 → 品牌提及 → 推荐 → 业务结果
这十个环节中的任何一处失败,都会改变最终答案。只看最后一层,无法判断问题发生在哪里。

四、2026 年几条新证据,正在把 GEO 从“写法技巧”推向“链路科学”
把这篇思维链安全论文与 RAG、GEO 论文及平台官方说明放在一起,会看到一个比“隐藏关键词”更可靠的方向。
1. 搜索触发与查询扩展真实存在,但具体规则通常不可见
Google 已公开说明,AI Overviews 和 AI Mode 可能使用 query fan-out:围绕子主题和不同数据源发出多次相关搜索。OpenAI 的开发者文档也区分了快速搜索与 agentic search,后者可以主动管理搜索、分析结果并决定是否继续。
这支持企业建立“问题家族”而不是单一关键词表。一个“适合制造业的 ERP”问题,可能被拆成行业适配、部署方式、价格、集成、实施周期、风险、案例等多个子问题。
但平台公开了“会扩展”,不等于公开了每次扩展出的具体查询,更不等于企业已经获得了一份稳定的隐藏词典。
2. 被咨询的来源与最终引用的来源不是同一集合
OpenAI 的 web-search API 文档允许开发者读取 sources 字段。官方说明,这个字段记录模型形成回答时咨询过的 URL,数量通常多于最终显示的 inline citations。
这给出一个非常重要的可观测事实:没被引用,不等于没被看见;被引用,也不等于它改变了推荐。
来源进入候选、被模型咨询、进入上下文、支撑某个事实、显示为引用,是不同事件。
3. 内容写法的强证据,主要发生在“已经被检索之后”
2024 年发表于 KDD 的原始 GEO 论文经常被概括为“引用、统计和引语可以把可见度提高 40%”。这个数字需要加上关键条件。
论文先为每个查询取得 Google 的前五个来源,再从这些已经检索到的来源中随机选择一个做内容改写。它测量的是来源进入上下文后,在生成回答中的可见度变化。其 Perplexity 实验同样通过上传文件、要求模型只使用所给文件来回答,共测试 200 个样本。
这证明:当内容已经来到模型面前时,表达方式可能影响采用和引用。它没有证明同样的改写会提高自然抓取、自然召回或搜索排名。该论文也在限制部分明确写明,没有评估 GEO 改写对搜索排名的影响。
关键词堆砌在其设置中表现不稳定或更差。这进一步说明,语义覆盖和证据质量不等于重复关键词。
4. 长上下文并不意味着证据一定会被使用
RAGAS 把 RAG 质量拆成三个维度:检索是否找到相关且聚焦的上下文、模型是否忠实利用它、最终生成是否优质。ALCE 又把流畅度、正确性和引用质量分开。相关研究还发现,即使信息已经放进长上下文,位于不同位置也可能导致明显不同的利用效果。
因此,“页面被抓取了”和“事实被模型吸收了”之间,仍然隔着检索、重排、上下文位置、冲突判断和生成约束。
5. 目前还没有一个被充分验证的跨平台 GEO 万能公式
一篇 2026 年的 GEO critical survey 预印本梳理了 45 项相关研究。它给出的谨慎结论是:目前较有力的证据,主要支持“已被检索的内容可以影响引用或采用”;尚未找到一种已经展示稳定、纵向、跨平台自然可发现性和下游行为因果效果的通用技术。
这篇综述本身尚未经过同行评审,不能被当成最终裁决。但它与原始 GEO 论文的实验边界、平台官方说明和 RAG 评估研究互相吻合。
截至 2026 年 8 月,更诚实的结论不是“GEO 已经有一套确定排名公式”,而是:我们开始知道必须分层测量什么,也开始知道哪些流行结论还缺实验。
五、未来 GEO 的真实方法论:不读“模型心事”,研究决策因果
所谓 LLM Decision Causality,不是试图还原模型每一个神经元的内部活动,也不是把一段思维链当成真相。
它研究的是一个更可操作的问题:
当企业改变某一项真实信息、内容结构或来源配置时,AI 的召回、采用、引用、提及、推荐和业务结果,究竟在哪一层发生了可重复变化?
这要求每次研究先定义准确的效果对象。
例如,“增加一个带日期和来源的事实块是否有效”,至少可以对应三个完全不同的问题:
- 页面已经进入上下文后,它是否更容易被正确采用?
- 页面已进入候选集后,它是否更容易被选进上下文?
- 在公开网络中,它是否更容易被自然检索到?
三个问题需要三种实验。把文件手工塞给模型,只能回答第一个问题;它不能证明第三个问题。
同样,“品牌 A 被引用了”也不能直接证明“品牌 A 因这条引用而被推荐”。引用可能只是给一个早已形成的判断补上出处;也可能被用于描述风险,而不是背书。
真正可靠的 GEO 研究,至少遵守五条规则:
- 一个实验只回答一个层级的问题。 抓取、召回、采用、引用和推荐分别设指标。
- 保留分母。 引用率究竟除以全部问题、触发搜索的问题、召回该页面的问题,还是使用了该证据的问题,必须说明。
- 设置对照。 除了改写版本,还要有等长但不增加目标证据的 sham edit、负面对照问题和未处理页面。
- 记录中间状态。 能记录 query、sources、retriever score、context 和 citation 时,不只保存最终回答。
- 跨模型、改写问题和时间复测。 一次回答只是一次观察,不是平台规律。
六、RAG 应该成为 GEO 的实验室,公开网络才是最终考场
闭源 AI 搜索的很多中间层不可见,直接在公开网络上实验,很容易遇到一个问题:结果变了,但不知道为什么。
企业内部可控的 RAG 系统,反而适合承担“机制实验室”的角色。
在 RAG 实验室里,可以固定语料、检索器、候选文档和模型,再系统测试:
- 原子事实块是否提高正确采用率;
- 同一证据位于上下文开头、中部、末尾时是否不同;
- 有品牌先验和无品牌先验时,模型如何处理相同证据;
- 官网自述、独立第三方佐证和重复镜像之间是否存在差异;
- 证据被采用但不引用、被引用但不改变答案的比例各是多少。
其中最重要的一组实验,是把“品牌先验”和“实时检索”拆开。
可以交叉设置三个因素:
- 熟悉品牌或虚构品牌;
- 允许检索或关闭检索;
- 目标证据存在或不存在,进一步加入支持证据与冲突证据。
如果熟悉品牌在关闭检索后仍有优势,说明存在 prior-driven path 的可能;如果答案只在目标证据进入上下文后改变,则支持 retrieval-mediated path;如果被引用但推荐没有变化,说明引用与决策影响并不是一回事。
这些机制先在受控环境里筛选,再进入公开网络。
公开网络的实验要使用自有、授权页面,采用配对页面、等长假处理、固定问题集和预先确定的观察窗口。还必须等处理组与对照组都确认被抓取或索引后,再判断内容是否影响自然召回。否则,上游页面根本没有送达,任何下游“内容无效”结论都站不住。
七、企业和品牌现在最该做什么
未来 GEO 的资产,不是一份神秘关键词表,而是一套可传递、可验证、可观测的企业证据系统。
优先级一:统一事实底座
建立版本化 Truth Pack,统一公司主体、产品名称、功能、价格、适用对象、服务地区、时间、数据口径、限制条件和原始证据。
官网、产品页、结构化数据、第三方资料、销售材料不应各写一套事实。事实冲突会让任何“优化文案”失去基础。
优先级二:确保机器能够访问
分别核对 Googlebot、OAI-SearchBot、PerplexityBot 等平台相关 crawler 的 robots、WAF、HTTP 状态、渲染 HTML、canonical、sitemap 和服务器日志。
Google 已明确表示,进入其 AI Features 不需要特殊 AI 文件或专用 schema;页面首先要满足普通搜索的技术资格。OpenAI 也明确把搜索 crawler 与训练 crawler 分开。允许训练并不等于搜索可见,反过来同样如此。
技术资格只能证明门没有锁,不能保证平台一定走进来。
优先级三:围绕决策问题建设 Answer-ready Evidence
不要只围绕宽泛词频写文章。企业需要建立 Prompt Map 或 Intent Map,覆盖客户从发现问题到采购决策的完整过程:
- 这是什么;
- 适合谁、不适合谁;
- 与替代方案有什么差别;
- 价格与实施条件是什么;
- 有哪些风险和限制;
- 有什么可核验案例或数据;
- 如何迁移、部署、验收和售后。
每个高价值问题都应有直接答案,并写清日期、口径、方法、适用条件、证据和限制。重要信息必须存在于可抓取文本中,不能只放在图片、视频或下载文件里。
优先级四:建设真实的外部佐证
客户案例、行业报告、权威目录、合作伙伴资料、公开数据和真实用户评价,可能帮助平台从多个来源理解同一实体。
但这里必须保持克制。现有证据还不足以证明“第三方页面越多,推荐概率就按固定比例上涨”。第三方佐证应当是真实事实网络,不是批量镜像、自导自演的评价或购买的虚假背书。它的增量价值,需要在控制相关性、位置和来源差异后继续测试。
优先级五:建立分层仪表盘
企业至少要能区分以下状态:
- 没有被抓取;
- 已抓取但没有进入可见索引;
- 触发了搜索但没有召回目标页面;
- 页面被咨询但证据没有进入回答;
- 事实被使用但没有显示引用;
- 品牌被提及但没有被推荐;
- 品牌被推荐但没有带来合格访问;
- 有访问但没有形成线索或成交。
一个总“AI 曝光率”无法告诉企业应该改技术、改内容、做第三方证据,还是修转化路径。
优先级六:每月只验证少量可证伪假设
一次改十个地方,只能知道“整个组合可能有效”,不知道究竟是哪一项起作用。
更好的节奏是每月选择一至两个假设:事实块、来源类型、页面结构、问题覆盖或上下文位置。预先写清处理、对照、主要指标、观察时间和什么结果会推翻判断,再进行跨平台和跨时间复测。

八、这条路线明确反对什么
如果把这篇思维链论文真正读完,企业至少应该避开七类“捷径”:
- 不把安全漏洞包装成已经破解 ChatGPT 或其他平台的 GEO 算法;
- 不从 reasoning summary 猜测所谓隐藏搜索关键词;
- 不把关键词堆砌当作语义覆盖;
- 不把 llms.txt、特殊 AI schema 或 IndexNow 的接收回执当作排名保证;
- 不把手工上传文件后的引用,写成自然网页召回提升;
- 不把一次回答、一次排名或一次前后变化当作稳定因果;
- 不公开原始 reasoning blocks、opaque fields、真实凭证和个人数据。
这些做法的共同问题,是跳过了决策链中间层,然后用一个容易传播的结果替代证据。
结语:GEO 的未来不是读心术,而是证据工程与因果实验
《Stealing Reasoning Traces from Proprietary LLM APIs》让人更具体地看到,隐藏推理与最终答案之间可能存在怎样的信息差。它也让“搜索、工具调用、策略变化和事后合理化”这些过去很难观察的现象变得具体。
但它没有交给企业一套隐藏排名公式。
恰恰相反,这篇论文提醒我们:即使拿到更多过程文本,也不能轻易把它当成完整因果真相。模型可能省略、合理化,也可能受 system prompt、工具权限、上下文和既有记忆共同影响。
因此,GEO 更成熟的方向不是破解模型的“心事”,而是建设一条可验证的证据链,并通过干预回答:
- 企业事实能不能被访问;
- 能不能进入候选和上下文;
- 能不能被正确理解和引用;
- 是否真的改变了品牌提及与推荐;
- 最终是否产生了正确认知、合格访问和业务结果。
谁能把这条链路分清、记录下来并持续实验,谁才真正拥有 GEO 方法论。
关于我们:妙蛙 GEO(Miaowa GEO)是天津思必得科技有限公司旗下产品。我们围绕 Prompt Map、多模型采样、Truth Pack 事实核验、引用来源归因,以及行动与复测闭环,研究企业和品牌在生成式搜索中的可见性。我们不代表任何第三方 AI 平台,也不承诺收录、固定排名、流量或收入。
本文资料来自《Stealing Reasoning Traces from Proprietary LLM APIs》、《GEO: Generative Engine Optimization》、《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》、《Query Rewriting in Retrieval-Augmented Large Language Models》、《RAGAs: Automated Evaluation of Retrieval Augmented Generation》、《Enabling Large Language Models to Generate Text with Citations》、《Lost in the Middle: How Language Models Use Long Contexts》、《RPO: Retrieval Preference Optimization for Robust Retrieval-Augmented Generation》、《Language Models Don't Always Say What They Think》、Google Search Central、OpenAI Developers、Perplexity Developers、IndexNow,以及《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》。其中目标论文与 2026 年综述截至本文写作时均为预印本。
本文由妙蛙 GEO 研究团队撰写,使用 AI 辅助进行资料整理与语言校对,文中事实、来源和结论均经人工复核。
