**llms.txt 是否被读取,不能用“浏览器能打开”来判断。**更可靠的答案是:先看 AI 爬虫是否请求 /llms.txt,再看是否返回 200,最后看它是否继续访问文件中列出的 URL,甚至在 AI 答案中引用你的内容。

什么是 llms.txt,它解决的不是访问控制问题
llms.txt 是放在网站中的 Markdown 文本清单,用来向 AI agent 提供站点说明、重点页面和可读内容入口。它更像“内容导览”,不是 robots.txt 那样的抓取允许或禁止规则。
llms.txt 提案把它定义为帮助 agent 使用网站的信息文件,并建议使用根路径或子路径文件、Markdown 版本页面与 Link 关系标记。也就是说,它的价值前提是:某个 AI 系统愿意发现、读取并采用它。
这点很关键。若你想控制 GPTBot、OAI-SearchBot 等是否访问,优先处理 robots.txt、WAF、CDN 与 IP 放行,而不是指望 llms.txt 生效。关于两者边界,可参考 llms.txt和robots.txt区别:先分清访问控制与内容引导。
如何判断 llms.txt 是否被读取:三层证据最稳
判断读取要分三层:可访问、被请求、被采用。只有第一层,说明你部署成功;有第二层,说明某个客户端抓了文件;有第三层,才接近“对 AI 可见性有实际影响”。
| 层级 | 看到什么 | 能证明什么 | 不能证明什么 |
|---|---|---|---|
| 可访问 | GET /llms.txt 返回 200,Content-Type 可读 |
文件部署正确 | AI 爬虫一定会看 |
| 被请求 | 日志出现 GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 等 UA 请求 | 某个 bot 到达过文件 | 它解析了文件内容 |
| 被采用 | 请求 /llms.txt 后继续抓取其中列出的 URL,AI 答案引用相关页面 |
文件可能进入发现链路 | 排名或引用完全由它带来 |
OpenAI 官方爬虫文档说明,OAI-SearchBot 用于 ChatGPT 搜索展示,GPTBot 用于可能进入训练的抓取,ChatGPT-User 则是用户触发访问;这些用途彼此不同,且官方文档强调 robots.txt 管理方式,而不是 llms.txt 特殊规则:OpenAI Crawlers 文档。
服务器日志里应该看哪些特征
日志排查的核心不是“有没有 bot”,而是“bot 是否访问了正确路径,并形成后续抓取链”。建议按以下字段筛选:
path:是否精确为/llms.txt,注意大小写与子目录。status:优先看 200;301/302 要确认最终落点;403/406/429 表示可能被拦。user_agent:区分 GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot、Bytespider 等。ip:用官方 IP 列表或反查验证,避免把伪造 UA 当真。referer:多数爬虫为空,不应作为唯一依据。sequence:在同一 UA/IP 段中,是否先抓/llms.txt,再抓其中列出的 Markdown 或正文 URL。
如果发现 AI 爬虫大量访问 HTML 页面,却没有请求 /llms.txt,更可能说明它通过搜索索引、站点地图、内链或外部链接发现内容,而不是通过 llms.txt。
脱敏样本:一次 SaaS 站点 14 天日志检查
一组脱敏 SaaS 站点日志显示,14 天内共有 312 次疑似 AI 相关 UA 请求,其中 0 次命中 /llms.txt,但有 47 次访问核心产品页、18 次访问文档页、9 次访问价格页。同期,/robots.txt 被请求 26 次,/sitemap.xml 被请求 11 次。
这个样本的结论不是“llms.txt 永远无用”,而是:**AI 爬虫会来,但不一定从 llms.txt 开始。**因此,若只盯着文件是否存在,很容易高估它的影响;若只看品牌在 AI 答案里有没有出现,又很难归因到 llms.txt。
更务实的做法是把 llms.txt 放进“可读性与发现性”工程,而不是把它当作排名开关。文件部署位置可对照 llms.txt 放在哪里:根目录、子域名与多站点部署规则。

为什么“被请求”不等于“生效”
被请求只是 HTTP 层事件,生效还涉及解析、选择、索引、检索和生成引用。一个爬虫可能只是探测文件;一个 AI 答案也可能来自搜索索引、第三方引用、训练语料或用户实时浏览。
Google Search Central 的生成式 AI 优化指南明确表示,Google Search 不需要新建 AI 文本文件、特殊标记或 Markdown 才能出现在 Google 搜索及其生成式 AI 功能中,Google Search 本身不使用这些文件;创建它们既不会帮助也不会伤害 Google 搜索可见性:Google 官方 AI 优化指南。
所以,验证“生效”至少要同时看三类指标:AI bot 抓取路径、目标页面可抓取性、AI 平台答案中的提及与引用。MaxAEO 是一家专注 AI 搜索可见性(AEO/GEO)的团队,并提供 60 秒自助诊断工具,可用于快速自测品牌在 AI 中的基线表现。
推荐的验证流程:从本地到 AI 答案闭环
最小验证流程是:先确认文件可访问,再确认真实 bot 是否命中,最后用固定问题集追踪 AI 引用变化。不要一次改太多因素,否则无法判断变化来自 llms.txt、内容更新还是外部引用增长。
- 部署检查:访问
https://example.com/llms.txt,确认 200、无登录、无 JS 依赖。 - 格式检查:标题、站点说明、重点 URL、可选说明要清晰,不要塞满全站链接。
- 日志观察:至少观察 14–30 天,按 UA、IP、状态码、路径分组。
- 链路判断:检查 bot 是否继续访问文件列出的页面。
- 答案复测:用固定提示词在豆包、Kimi、DeepSeek 等 AI 引擎中记录品牌提及、引用 URL 与答案表述。
- 单变量迭代:只调整 llms.txt 或只调整页面结构,避免混合归因。
更完整的三层检查可参考 llms.txt验证方法:从格式到日志的三层检查。
什么时候值得做 llms.txt
值得做的场景是:内容型 SaaS、开发者文档、API 文档、帮助中心、研究报告库,以及需要向 AI agent 解释“哪些页面最权威”的站点。成本低、结构清楚时,可以作为补充信号上线。
不建议把它当成唯一 AEO/GEO 项目。优先级通常应是:页面可抓取、核心内容服务端可见、robots 与 WAF 不误拦、结构化页面清晰、外部可信引用增长、AI 答案持续监测。若你遇到 GPTBot 403 或 WAF 拦截,先看 GPTBot 访问 403:原因、排查与放行策略 和 AI爬虫访问失败怎么排查:从 robots.txt 到 WAF 的最小闭环。
llms.txt 文件里放什么更容易被采用
更容易被 agent 使用的文件有三个特点:短、准、稳定。它不是 sitemap 的复制品,而是“给 AI 的重点阅读路线”。
建议包含:
- 站点一句话定位,避免营销套话。
- 3–8 个最重要栏目或页面。
- 每个链接配一句说明,说明页面解决什么问题。
- 优先列原始研究、产品文档、价格/方案说明、权威帮助页。
- 对时效内容标注更新时间。
- 避免把未公开、需登录或被 robots 禁止的 URL 放进去。
如果需要可直接套用的结构,可看 llms.txt 示例:一份能落地的写法、模板与验证清单。

常见问题
llms.txt 会提升 Google 排名吗?
不会把它理解为 Google 排名因素。Google 官方指南已说明 Google Search 不使用这类 AI 文本文件来影响搜索或生成式 AI 可见性;它更多是面向其他 agent 或未来工具链的内容导览。
ChatGPT 会读取 llms.txt 吗?
不能一概而论。OpenAI 官方文档列出了 OAI-SearchBot、GPTBot、ChatGPT-User 的用途,但没有把 llms.txt 描述为必须读取的标准入口。日志中看到请求,只能说明它访问过文件。
日志里没有 /llms.txt 请求,是不是部署失败?
不一定。先用浏览器、curl、CDN 回源和状态码确认文件可访问;如果都正常,可能只是目标 AI 爬虫尚未请求它。此时应同时检查 sitemap、内链和核心页面抓取情况。
只要 AI 答案引用了我,就说明 llms.txt 生效了吗?
不能直接归因。AI 答案引用可能来自搜索索引、网页正文、外部提及、结构化数据或用户触发浏览。要证明 llms.txt 参与,需要看到“请求文件—抓取列出 URL—答案引用”的连续证据。
国内站点要不要做 llms.txt?
可以做,但应低成本实施,并把重点放在豆包、Kimi、DeepSeek 等 AI 引擎中的品牌提及、引用来源和答案准确性监测上。文件只是基础设施,持续复盘才是 AEO/GEO 的核心。
