返回技术文章
llms.txtGEOAI 爬虫技术 SEO

llms.txt 到底有没有用?2026 年的证据与建议

Google 官方已明确表示忽略 llms.txt,Ahrefs 对 13.7 万个域名的抓取日志显示 97% 的文件从未被读取。本文汇总现有全部公开证据,给出企业该不该做的判断。

妙蛙 GEO 研究团队11 分钟

结论先讲:截至 2026 年 7 月,没有任何一家主流 AI 搜索平台公开确认在生产环境中使用 llms.txt 作为引用信号或收录依据。Google 已在官方文档中明确写明会忽略该文件;Ahrefs 对 13.7 万个域名的抓取日志分析发现,97% 的 llms.txt 文件在一个月内没有收到任何请求。对绝大多数企业网站而言,llms.txt 不是 GEO 优先级事项。唯一有实际价值的场景是开发者文档站。

这个结论和 2025 年市面上大量"GEO 必做清单"里的说法相反。下面我们把所有可核查的证据摆出来。


一、llms.txt 是什么,它承诺解决什么问题

llms.txt 是 2024 年 9 月由 Jeremy Howard(Answer.AI)提出的一个社区提案。核心想法是:在网站根目录放一个 /llms.txt 的 Markdown 文件,用简洁结构告诉大语言模型"这个站是干什么的、哪些页面重要",从而降低模型理解网站所需的成本。

它常被类比为"给 AI 看的 robots.txt"。这个类比其实是误导性的,两者性质完全不同:

robots.txtllms.txt
性质事实标准,1994 年起被普遍遵守社区提案,无标准化组织背书
作用方向限制访问(告诉爬虫别抓什么)声明内容(告诉模型我是什么)
谁在遵守Google、Bing、OpenAI、Anthropic、Perplexity 均公开支持无主流平台公开确认在检索环节使用
是否可被操纵不涉及内容主张完全由站长自述,天然可操纵

最后一行是理解整件事的关键。

二、Google 的官方立场:三次表态,一次比一次明确

第一次,2025 年,John Mueller 的公开回应。 Mueller 把 llms.txt 类比为 keywords meta 标签——这个标签因为完全由站长自行声明、容易被滥用,已经被搜索引擎忽略了十几年。他的核心逻辑是:站长自己声明的网站是什么样,和网站实际是什么样,未必一致;既然可以直接检查网站本身,为什么要相信一份自述文件。

第二次,2025 年 12 月的乌龙事件。 12 月 3 日,Google 自家开发者文档站上短暂出现了 llms.txt 文件,SEO 圈立刻沸腾。当天文件即被撤下。Google 后续解释,这是其内部 CMS 平台增加了该功能后的自动产物,不代表 Search 团队的任何立场。当有人追问"Google 自己的站上有这个文件是不是一种背书",Mueller 的回答只有一个字:不是。

第三次,2026 年 5 月 15 日,写进官方文档。 Google 在 Search Central 发布《Optimizing your website for generative AI features on Google Search》,其中专门设置了一个"你不需要做什么"的辟谣章节。该文档明确写道,站长不需要为了出现在 Google 搜索(包括其生成式 AI 功能)中而创建新的机器可读文件、AI 文本文件、标记或 Markdown,因为 Google 搜索本身不使用它们。文档同时说明,Google 可能会像抓取其他文件一样抓取并索引这类文件,但这不意味着该文件受到任何特殊对待;如果站长出于其他系统的需要而维护 llms.txt,完全没问题,它既不会损害也不会提升网站在 Google 搜索中的可见度或排名。

这段话的措辞值得注意:不是"暂不支持",而是"忽略"。这是一个稳定的、可长期依赖的表态。

三、抓取日志说了什么:97% 的文件无人问津

官方表态之外,还有一个更硬的证据来源——服务器日志。平台可以说任何话,但爬虫有没有来过,日志不会撒谎。

Ahrefs 在 2026 年 6 月发布了目前规模最大的一次实测。研究覆盖了 Ahrefs Web Analytics 中 2026 年 5 月有流量的全部 137,210 个域名,逐个检查根目录下 llms.txt 是否返回 HTTP 200,再用 Bot Analytics 统计所有对 /llms.txt 路径的请求,按 HTTP 响应状态和用户代理分类。为排除软 404 和幽灵文件,研究还确认了每个文件确实是 Markdown 而非 HTML,并筛查标题与内容中是否含有错误信号。这个方法论设计是干净的:它测的不是"有多少人做了这个文件",而是"做了之后有没有机器来读"。

核心发现有两个:

  1. 97% 的 llms.txt 文件在 2026 年 5 月零请求。 也就是说,AI 爬虫根本不去读它。
  2. 采纳率约 28%,但这个数字要打折看。 Ahrefs 自己提示,其 Web Analytics 客户群体的技术和 SEO 意识高于全网平均水平,因此 28% 应被视为上限。更重要的是,这个采纳率的增长主要来自 SEO 插件和 CMS 的默认开关——一键就能打开,不代表任何人验证过它有效。

把两个数字放在一起,图景很清楚:采纳在涨,使用没跟上。 这是典型的"行业自我说服"现象。

四、那 Chrome 的 Lighthouse 为什么在检查它?

这是 2026 年 5 月最容易让人困惑的一点,值得单独解释,因为很多服务商正在用这件事当卖点。

在 Google 发布辟谣指南后的几天内,Chrome 团队在 Lighthouse 的实验性"Agentic Browsing"审计中上线了一项 llms.txt 检查,文档说明是:缺少该文件时,智能体可能需要花更多时间抓取网站才能理解其结构。于是出现了一个表面矛盾:Search 团队说没用,Chrome 团队在检查。

当 Lily Ray 就此追问 Mueller 时,他的解释是:llms.txt 不是为搜索做的,它是一根"临时拐杖",用途是帮 AI 编程工具在解析开发者文档时省一些 token,非开发者类网站不必操心。

所以两件事从来不矛盾,它们说的是两个完全不同的场景:

  • 检索与引用(你被 ChatGPT / AI Overviews 提到)→ 与 llms.txt 无关。
  • 智能体浏览(AI Agent 要在你站上完成一个操作)→ 属于早期基础设施议题,llms.txt 是其中一个候选方案,但远未定型。

顺带一提,Mueller 在同期的讨论中还提到他更看好 WebMCP 这个由 Google 支持的替代提案。如果你确实关心智能体可用性,那个方向比 llms.txt 更值得跟踪。

五、其他平台呢

这是必须补充的一节,因为 Google 的表态只对 Google 有效。

  • OpenAI、Anthropic、Meta:截至 2026 年,均未公开承诺在生产系统中读取或使用该文件。
  • Perplexity:其官方爬虫文档说明了 PerplexityBot 和 Perplexity-User 的行为以及站长如何管理访问,其中不存在任何 llms.txt 要求,无论是收录还是引用。
  • 国内平台(豆包、DeepSeek、元宝、夸克、秘塔等):均无公开的 llms.txt 支持声明。就我们目前的抓取日志观察,国内 AI 爬虫对该路径的请求量可以忽略不计。

需要诚实说明的是:"没有公开确认"不等于"绝对没在用"。 各家的检索管线是黑箱,理论上存在私下使用而未公开的可能。但在做优先级判断时,一个既无官方支持、又无日志证据的做法,不应该排在你的资源列表前面。

六、唯一真正成立的使用场景

llms.txt 有一个窄但真实的用途:开发者文档站。

AI 编程助手(如 Cursor、GitHub Copilot、Claude)会实时检索你的文档。llms.txt 能帮它们更精准地取到正确页面,减少 token 浪费。llms-full.txt 是配套格式,把整站内容合成一份 Markdown 供深度读取;大多数站点只需要 llms.txt,文档量大的 SaaS 产品两者都维护会有收益。实施成本不到 30 分钟。

采纳者的分布也印证了这一点:Stripe、Cloudflare、Vercel、Supabase、Anthropic 这类文档密集型平台是最显眼的使用者,这与 Mueller 关于该文件真实用途的说法高度吻合。

判断标准很简单:如果你的客户是开发者、你的产品需要被 AI 编程工具正确调用,做。否则,不做。

七、给三类企业的具体建议

企业类型建议理由
外贸 B2B / 跨境电商 / 一般中小企业不做,或用插件一键生成后不再投入任何维护成本无收益证据,维护成本却是长期的(内容更新后文件会失效)
技术型 SaaS、API 产品、有公开文档站做 llms.txt,文档量大可加 llms-full.txt唯一有实证价值的场景
已经被服务商收费做了 llms.txt不用删,但要求对方说明这项服务的效果验证方式该文件不会造成损害,但为它单独付费不合理

如果一定要做,只需注意三点:放在根目录、返回 200 且 Content-Type 正确、内容与站点实际结构保持同步。做错了不会有惩罚,但一份过期的自述文件不如没有。

八、这件事真正的启示

llms.txt 的价值不在于它本身,而在于它是一个极好的服务商鉴别器

2026 年,如果一家 GEO 服务商还把 llms.txt 作为核心交付项、放在方案第一页,说明它的方法论停留在 2025 年上半年,且没有建立任何"用日志和实验验证结论"的习惯。这类服务商在其他环节大概率也是在卖直觉,而不是卖证据。

反过来,这也是我们做这个博客的原则:任何一条 GEO 建议,我们都要能回答"证据是什么、谁做的、怎么测的、什么时候会失效"。 llms.txt 这个案例里,四个问题的答案都很清楚,所以结论也很清楚。


常见问题

Q:我已经做了 llms.txt,需要删掉吗? 不需要。Google 明确说明该文件既不加分也不减分。删除它唯一的收益是省下维护成本。

Q:llms.txt 会泄露我的内容让 AI 白嫖吗? 不会增加额外风险。文件里的内容本来就是你公开页面的目录。如果你担心内容被抓取用于训练,正确的工具是 robots.txt 和各平台的爬虫控制指令,不是 llms.txt。

Q:那 robots.txt 要不要针对 AI 爬虫调整? 这才是真问题,而且很多站踩了坑。有实测数据显示相当比例的站点因为 robots.txt 配置或 WAF 规则,无意中屏蔽了 AI 爬虫,导致内容根本无法被引用。这个优先级远高于 llms.txt。

Q:国内平台以后会支持 llms.txt 吗? 目前没有任何公开信号。我们会持续监测国内主流 AI 爬虫对 /llms.txt 路径的请求量,如有变化会更新本文。

Q:那我到底该把资源投在哪? 按证据强度排序:① 确保 AI 爬虫可访问(robots.txt / WAF / 渲染);② 产出他人无法复制的原创内容与数据;③ 建立跨平台的品牌实体一致性;④ 在高引用率的第三方平台建立真实存在。llms.txt 排在这四项之后。


本文数据来源:Google Search Central 官方文档(2026-05-15 发布,2026-07-10 最后更新)、Ahrefs 137,210 域名抓取日志研究(2026-06)、John Mueller 公开表态。所有结论会随平台政策变化更新,本文最后核查日期:2026 年 7 月 31 日。

作者:妙蛙 GEO 研究团队 | 我们通过持续监测多平台 AI 引用数据,为外贸与跨境企业提供可验证的 AI 可见度报告。

继续阅读

相关技术文章

Google AI ModeGoogle AI Mode 把旅行搜索推进到预订:GEO 的目标不能再只看引用

Google 8 月 27 日把航班价格跟踪、积分与里程价格、酒店预订带入 AI Mode。本文拆解开放网页、合作伙伴实时数据与交易入口的三层关系,以及旅行品牌怎样重设 GEO 衡量口径。

RedditReddit 出现在 83.9% 的 Google 论坛结果里:但这不是 AI 引用率

Ahrefs 8 月 27 日公布大样本研究,称 Reddit 出现在全球 83.9% 的 Google“讨论和论坛”模块中。本文复核 1.45 亿条美国结果的分母、平台集中度与外链结论,并解释它为什么不能替代 AI 引用监测。

RedditReddit 在 ChatGPT 里没有“消失”:8 月 25 日反例揭示聚合引用率为什么会误导 GEO

8 月 25 日的一组 ChatGPT 浏览器流量观测显示,Reddit 在一条查询中拿到 8 个引用中的 6 个,在另一条查询中却检索 84 次、引用 0 次。本文解释聚合引用份额、查询级检索和最终引用为什么不能混为一个指标。