llms.txt是什么?要不要做、怎么写(附中文网站示例)

llms.txt 文件在网站根目录的位置示意图,与 robots.txt、sitemap.xml 并列

llms.txt 是一个放在网站根目录、用 Markdown 写成的纯文本文件,作用是给大语言模型(LLM)提供一份精简的内容索引,告诉 AI 你的网站有哪些重要页面、各自讲什么。它常被拿来和 robots.txt、sitemap.xml 类比——robots.txt 管"能不能爬",sitemap 管"有哪些 URL",而 llms.txt 想管的是"AI 该优先读哪几页、怎么读懂"。

自 2024 年 9 月被提出后,它常被说成"AI 时代的标配"。但要不要花时间做、对中文站有没有用,得用数据说话,而不是跟风。

一句话结论:截至 2026 年中,没有可测量的证据表明 llms.txt 能提升 AI 引用或排名,主流 AI 爬虫几乎不请求它。它对开发者文档站值得做,对绝大多数中文品牌/营销站属于"低成本顺手做、但别指望立刻见效"。 把同样的时间投到 robots 放行、内容可读性和结构化数据上,回报高得多。

llms.txt 文件在网站根目录的位置示意图,与 robots.txt、sitemap.xml 并列

llms.txt 是什么?一句定义

llms.txt 是一份位于 https://你的域名/llms.txt 的 Markdown 文件,用结构化的标题和链接列表,把网站最重要的内容"喂"给大模型,方便 AI 在回答问题时快速定位和理解你的站点。

它由 Answer.AI 联合创始人 Jeremy Howard 于 2024 年 9 月 3 日提出。动机很现实:大模型的上下文窗口装不下整个网站,而真实网页里充斥着导航、广告、JavaScript,转成干净文本既难又不准。llms.txt 的设想,是让网站主动给出一份"AI 友好"的精简索引,绕开这些噪音。

需要分清的是,llms.txt 是一个"提议中的社区规范",不是 Google、OpenAI 或任何平台发布的官方标准。这一点直接决定了它今天的实际效果。

llms.txt 与 robots.txt、sitemap.xml 有何区别

三者都在根目录、都给机器看,但目的完全不同:

文件 面向对象 回答的问题 是否官方标准
robots.txt 所有爬虫 哪些路径能不能 是(事实标准)
sitemap.xml 搜索引擎 站内有哪些 URL、更新频率 是(Google/Bing 支持)
llms.txt 大语言模型 AI 该优先读哪几页、怎么读懂 否(社区提议)

简单说:robots.txt 是门禁,sitemap.xml 是全量地址簿,llms.txt 想当"给 AI 的精选导读"。前两个被搜索引擎明确支持,llms.txt 还没有。至于该给哪些 AI 爬虫放行,是 robots.txt 要解决的问题,和 llms.txt 是两回事。

llms.txt 长什么样?格式与 llms-full.txt 的区别

llms.txt 是合法 Markdown,按固定顺序排列:一个 H1(唯一必需项)、一段引用块摘要、可选的说明段落,再加若干 H2 分节,每节用列表列出关键链接。格式克制、能被任何标准 Markdown 解析器读取,是它和 XML 类格式最大的不同。

官方规范(见 llmstxt.org 的 /llms.txt 规范)定义的结构如下:

  • H1 项目/站点名称——唯一强制项。
  • 引用块 > 摘要——一句话讲清网站是做什么的。
  • 零个或多个普通段落——补充说明,不能再用标题。
  • 若干 H2 分节——每节下用 - [链接标题](URL):说明 的格式列资源。
  • 特殊的 ## Optional 分节——里面的链接在"需要更短上下文"时可被 AI 跳过。

规范还建议:给每个网页提供一个在原 URL 后加 .md 的纯文本镜像(如 /product 对应 /product.md),让 AI 拿到无噪音的正文。

llms.txt 和 llms-full.txt 是两份不同的文件,别搞混:

文件 内容 类比
/llms.txt 导航索引:列关键页面+简短说明,不含正文 一本书的目录
/llms-full.txt 全文合集:把核心内容塞进一个 Markdown,供 AI 一次读完 把整本书拼成一个文件

文档量大的站点,llms-full.txt 能让 AI 一次请求就拿到完整内容,理论上更准。但文件越大,越接近"把整站塞给模型",实际收益和维护成本要权衡。

llms.txt 真的有用吗?2400 个域名的引用数据

直接给结论:目前没有可测量的证据表明 llms.txt 能提升 AI 引用率或排名,因为主流 AI 爬虫几乎不去请求这个文件。这不是观点,是日志和引用数据跑出来的结果。

MaxAEO 在 2026 年 2—4 月对 2,400 个追踪域名做了对照分析(完整方法见 Does llms.txt Work? Evidence From AI Citation Data),关键数字如下:

  • 采用率仅 13.6%(326 个域名部署了 llms.txt)。
  • 240 对条件相近的配对域名中,有 llms.txt 的 AI 引用率为 11.8%,没有的为 11.6%——差距只有 +0.2 个百分点,落在测量噪声范围内
  • 在部署前后做自身对比的 58 个域名,引用率中位变化为 +0.1pp,而同期对照组是 +0.2pp。换句话说,部署了的反而没比没部署的涨得多。

爬虫日志的证据更直接:

  • 第三方监测 OtterlyAI 的 90 天实验里,62,100+ 次 AI 机器人访问中,只有 84 次(约 0.1%)请求了 /llms.txt
  • 技术团队 Evil Martians 对两个高流量站做 CDN 分析,GPTBot、ClaudeBot、PerplexityBot 对 Markdown 文件的请求数为零
  • MaxAEO 自有客户日志里,19 个站只有 3 个收到过 /llms.txt 请求,合计 41 次——同期 AI 爬虫抓取页面约 110 万次

平台立场也一致:OpenAI、Google、Anthropic、Perplexity、Microsoft 没有任何一家承诺使用 llms.txt。Google 搜索倡导者 John Mueller 曾公开把它类比为早已弃用的 keywords meta 标签;Google 的 Gary Illyes 在 2025 年也表示 Google 不支持、也没有计划支持该文件。

240 对域名在有无 llms.txt 情况下的 AI 引用率对比柱状图,差距仅 0.2 个百分点

唯一站得住脚的正向用途:开发者文档站。Stripe、Vercel、Cloudflare、Anthropic、Cursor 这些 API/工具产品都上了 llms.txt,因为它们的用户正用 Cursor、Claude Code、Copilot 这类编码助手实时拉取文档——这些 IDE Agent 确实会读 llms.txt。中文圈里,尤雨溪也给 Vue、Vite 生态做了 llms.txt,同样是文档场景。

中文站到底要不要做 llms.txt?

判断标准只有一条:你的内容会不会被 AI 编码助手或 Agent 在工作流里直接调用。 是,就做;如果只是想"被 AI 搜索更多提及、提升品牌可见度",它今天给不了你这个结果,优先级应靠后。

按站点类型,给一份取舍清单:

建议做(投入产出比高):

  • 开发者文档 / API 站:用户拿 Cursor、Claude Code 直接拉文档,llms.txt 是真实入口。
  • 技术 SaaS 的帮助中心:内容结构清晰、更新可自动化,顺手做没坏处。
  • 本身就用 Mintlify、GitBook 等工具的站:这些平台能自动生成,几乎零成本。

可做可不做(顺手做,但别排期、别考核效果):

  • 品牌官网 / 营销站:低成本部署没问题,但别指望它带来提及或排名。
  • 媒体 / 内容站:文章多、变化快,维护 llms-full.txt 成本高于收益。

先别做(把时间投到别处):

  • 资源紧张、目标是 AI 可见度的中文电商/消费品牌站:当下回报接近零。
  • 正面临"AI 抓不到内容"这类基础问题的站:先解决能不能被爬、能不能被读,llms.txt 是锦上添花,不是雪中送炭。

对中文站还有一个常被忽略的现实:DeepSeek、豆包、Kimi、通义千问等国内 AI 平台,同样没有任何一家公开声明读取 llms.txt,整体态势和海外一致。所以"做了就能在 DeepSeek、豆包里被更多推荐"是没有依据的预期。真正影响中文 AI 引用的,是你的内容有没有出现在它们爱抓的来源里。

怎么写 llms.txt(附中文网站示例)

写一份合规 llms.txt 只需五步,10 分钟能搞定:

  1. 建文件:在站点根目录新建 llms.txt,确保能通过 https://你的域名/llms.txt 访问。
  2. 写 H1 + 摘要:一个 H1 放品牌名,紧跟一段 > 引用块,一句话说清你是做什么的。
  3. 可选补充说明:用普通段落补关键背景(成立时间、核心场景),不要再用标题。
  4. 分节列链接:用 H2 把内容按"产品 / 文档 / 关于"等分组,每条用 - [标题](URL):说明
  5. 次要内容进 Optional:博客、归档等放到 ## Optional,让 AI 在上下文紧张时可跳过。

一份中文品牌站的完整示例:

# 示例品牌(PinPai)

> 示例品牌是一家专注于办公协作软件的 SaaS 公司,主营在线文档、项目管理与团队知识库。

公司成立于 2019 年,总部位于杭州,服务超过 5 万家企业客户。

## 核心页面

- [产品介绍](https://example.com/product.md):在线文档、项目管理、知识库三大模块功能说明
- [定价方案](https://example.com/pricing.md):免费版、专业版、企业版的功能与价格对比
- [关于我们](https://example.com/about.md):公司背景、团队与发展历程

## 帮助文档

- [快速开始](https://example.com/docs/quickstart.md):5 分钟创建第一个团队空间
- [API 文档](https://example.com/docs/api.md):REST 接口与鉴权说明

## Optional

- [博客](https://example.com/blog.md):产品更新与行业观察

如果用 Mintlify、GitBook 等平台搭站,多数能一键生成 llms.txt,不必手写。部署前对照这份易踩的坑自查:

  • 多个 H1:规范只允许一个 H1,多了会被判为不合法。
  • 链接不写说明- [标题](URL) 后面没有冒号说明,AI 就少了判断依据。
  • 链接指向带噪音的 HTML 页:尽量指向 .md 镜像或干净正文。
  • 把整站链接全堆进去:llms.txt 是"精选导读",不是第二份 sitemap,堆满反而稀释重点。
  • 写完不更新:页面改版后链接失效,比没有还糟。

想让 AI 真正"读得懂"页面内容,光有 llms.txt 不够,正文本身的可读性更关键,可参考AI友好内容怎么写:定义、框架、示例与检查清单

中文品牌网站 llms.txt 文件内容示例截图,含 H1、摘要、分节链接与 Optional 段

写完之后,怎么验证它有没有被读取

别凭感觉,用服务器日志验证。判断 llms.txt 有没有起作用,唯一可靠的方法是看 AI 爬虫到底有没有来请求这个文件,以及部署前后引用率有没有真实变化。 一套可复测的 30 天协议如下:

  1. 建基线:部署前先收集 2 周的 AI 引用数据和爬虫访问日志,作为对照。
  2. 按规范部署 llms.txt(和可选的 llms-full.txt)。
  3. 盯日志:在服务器/CDN 日志里筛 GPTBot、ClaudeBot、PerplexityBot 等 UA 对 /llms.txt 的请求次数。
  4. 对比 30 天:把部署后 30 天的引用率与基线对比。
  5. 判读:变化必须明显超过正常的周间波动,才算"有效",否则就是噪声。

绝大多数站跑完会发现:对 /llms.txt 的请求次数接近零。这正是前面那组数据的微观写照,也说明为什么不该把它当成 AI 可见度的主力抓手。持续追踪品牌在各 AI 平台的提及、引用来源与竞品表现(做法见AI品牌监控报告怎么写:指标、模板、预警阈值与周报范例),比盯一个文件更能反映真实的 AI 可见度变化。

比 llms.txt 更值得先做的三件事

如果目标是 AI 提及率和 AI 搜索排名,把精力按下面的顺序投入,回报远高于 llms.txt:

常见问题

llms.txt 是必须做的吗?
不是。它是社区提议,非任何平台官方标准。开发者文档站建议做;普通中文品牌站属于低成本可选项,做了也别期待立竿见影的提及或排名提升。

做了 llms.txt,能直接提升在 DeepSeek、豆包里的品牌推荐吗?
目前没有依据。国内外主流 AI 平台都未公开承诺读取 llms.txt,2400 个域名的对照数据也显示引用率差异仅 0.2 个百分点,落在噪声内。

llms.txt 和 sitemap.xml 能互相替代吗?
不能。sitemap.xml 面向搜索引擎、给全量 URL,被 Google/Bing 正式支持;llms.txt 面向大模型、给精选导读,尚未被平台采用。两者目的不同,sitemap 仍是基础设施,llms.txt 是补充实验。

llms.txt 和 llms-full.txt 要不要都做?
看内容量。llms.txt 是目录、llms-full.txt 是全文合集。文档量小,一个 llms.txt 足够;文档量大且希望 AI 一次读完,再加 llms-full.txt,但要权衡维护成本。

怎么知道 llms.txt 到底有没有被 AI 读?
查服务器或 CDN 日志,筛主流 AI 爬虫 UA 对 /llms.txt 的请求次数,并对比部署前后 30 天的引用率变化。多数站会发现请求次数接近零。