llms.txt 合规检测:从语法通过到 AI 可用的检查清单

llms.txt 合规检测:从语法通过到 AI 可用的检查清单

作者:maxaeo.cn|发布日期:2026-08-25|更新日期:2026-08-25

llms.txt 合规检测是对网站根目录下 AI 可读说明文件的系统检查:不仅确认 /llms.txt 能访问,还要判断其结构、链接、内容事实和被 AI 引用的可能性是否达标。真正有用的检测,应从“存在”推进到“可解析、可信、可复测”。

llms.txt 合规检测四层框架示意图

什么是 llms.txt 合规检测?

llms.txt 合规检测指按公开约定和业务可用性,检查文件位置、Markdown 结构、链接清单、内容摘要、可访问性与后续引用效果的过程。它的目标不是拿到一个“通过”标签,而是降低 AI 系统误读网站的概率。

根据 llmstxt.org 对格式的说明,llms.txt 通常采用 Markdown:以 H1 标题标识项目或网站,随后可加入摘要、说明段落和 H2 分组链接列表。它不是 robots.txt,也不等同于 sitemap.xml;前者偏抓取权限,后者偏 URL 发现,而 llms.txt 更像给 AI 的“站点导览卡”。

如果你还在搭建文件,可先参考站内的 llms.txt 文件模板与配置指南;如果已经上线,则更应该进入合规检测阶段。

只检测“有没有文件”为什么不够?

只检测文件存在会漏掉最关键的问题:AI 能否读懂、是否会顺着链接找到权威页面、文件内容是否和官网事实一致。一个返回 200 的 llms.txt,仍可能因为结构混乱、链接失效或内容过期而不可用。

常见误区有三类:

  1. 有文件但无结构:只有一段公司介绍,没有 H1、摘要和分组链接。
  2. 有链接但不可追踪:链接跳转链过长、返回 403、被 WAF 或机器人规则误拦。
  3. 有介绍但不可信:文件写了最新产品能力,但官网、帮助中心、价格页没有对应证据。

这也是很多 llms.txt 检测工具只能解决第一步的原因。它们能指出 Markdown 语法或链接错误,却不能判断品牌定位是否一致、AI 回答是否真的引用了这些页面。

四层检测框架:从语法合规到 AI 可用

一份合格的 llms.txt 应同时通过四层检查:文件层、结构层、内容层和回声层。前三层解决“能不能读”,第四层解决“读了之后有没有影响 AI 回答”。

检测层级 核心问题 合格标准 常见修复
文件层 AI 是否能访问 /llms.txt 返回 200,文本可读,无登录限制 修复路径、HTTPS、MIME、WAF
结构层 是否可解析 H1 清晰,摘要简短,H2 分组链接格式一致 按 Markdown 重排
内容层 是否可信 品牌、产品、价格、功能与官网一致 删除夸大语,补权威页面
回声层 是否被采用 AI 回答中的描述、引用、推荐位有变化 做同口径复测与引用溯源

这个框架的增量在于把“校验”扩展到“效果验证”。尤其对 SaaS、工具站、内容站而言,llms.txt 不是孤立文件,而是 AI 搜索可见性系统中的一个信源入口。

文件层:先确认 AI 和检测器都能访问

文件层的答案很简单:先确保公开访问稳定,再谈内容优化。检测时应访问 https://example.com/llms.txt,确认状态码、重定向、缓存、编码和安全策略没有异常。

建议逐项检查:

  1. URL 是否位于根路径或清晰的子路径;
  2. HTTPS 是否正常,证书是否有效;
  3. 返回状态是否为 200,而不是 301 循环、403 或 404;
  4. 内容是否为纯文本 Markdown,避免输出 HTML 模板;
  5. CDN、WAF、Bot Fight Mode 是否误拦非浏览器访问。

如果 AI 爬虫或检测器出现 403,可结合 AI 爬虫访问被拦截的排查方法 逐层定位。很多问题不是 llms.txt 写错,而是访问链路把 AI 或验证器挡在门外。

结构层:检查 Markdown 是否符合可解析习惯

结构层的关键是稳定、简单、可预测。按 llmstxt.org 的说明,H1 是核心结构,摘要、说明段和 H2 链接分组可帮助模型理解站点重点。

一个实用的结构顺序如下:

# 品牌或项目名称
> 一句话说明网站做什么、服务谁、核心价值是什么。

补充说明:适用场景、主要产品、重要限制。

## 核心页面
- [产品介绍](https://example.com/product): 说明核心功能与适用人群
- [价格方案](https://example.com/pricing): 说明套餐、限制与购买方式

## 文档与帮助
- [帮助中心](https://example.com/docs): 使用教程和常见问题

## Optional
- [博客](https://example.com/blog): 延伸阅读,可在上下文不足时跳过

这里要避免两类写法:一是把 llms.txt 写成广告页,二是把 sitemap 全量复制进去。AI 更需要“优先读什么”和“为什么读”,不是几百个无说明链接。

更细的结构规则,可参考 llms.txt 语法规则:Markdown 写法、链接格式与校验清单

llms.txt 合规检测中的结构层校验清单

内容层:合规不等于可信,事实一致性更重要

内容层要回答一个问题:llms.txt 里的每句话,能否在官网或权威页面找到对应证据。对 AI 搜索而言,内容不一致比缺少文件更危险,因为它可能放大错误品牌认知。

建议重点核对 6 类信息:

  • 品牌名、公司名、域名是否一致;
  • 产品分类是否准确,避免跨类目蹭词;
  • 核心功能是否能在产品页找到证据;
  • 价格、套餐、服务范围是否过期;
  • 适用人群和不适用场景是否清楚;
  • 联系方式、隐私、安全说明是否与官网一致。

对于 SaaS 品牌,尤其要控制“第一”“唯一”“保证排名”等不可证实表述。MaxAEO 在 GEO/AEO 场景中也不建议用 llms.txt 承诺排名或霸屏,而应把它作为可核验信源的一部分:提供清晰事实、核心页面和可复测口径。

回声层:检测 AI 是否真的采用了你的信息

回声层是很多检测页忽略的部分:文件合规只是上线条件,AI 回答中的提及、排序、情感和引用变化,才是业务结果。上线后应做同一组问题、同一批平台、同一周期的复测。

可采用一个轻量复测表:

复测项 观察指标 判断方式
品牌是否被提到 提及率 10 个目标问题中出现几次
是否被推荐 推荐位次 在同类品牌中排第几
描述是否准确 事实准确率 功能、价格、适用人群是否讲对
是否引用自有站 引用来源占比 AI 回答是否引用官网、文档、博客
语气是否正向 情感倾向 正面、中性、负面关键词变化

MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,可监测品牌提及率、排序、情绪评价与引用来源。对于已经做过 llms.txt 的网站,可以结合 llms.txt 是否被读取的判断方法 和引用溯源一起看,而不是只看文件校验分数。

上线前的 12 项自查清单

上线前最有效的做法,是把 llms.txt 当作一次小型发布来验收。下面这 12 项适合技术、SEO 和品牌负责人共同过一遍。

  1. /llms.txt 可公开访问,状态码为 200;
  2. 文件不是空白页、HTML 页或下载异常;
  3. 只有一个清晰 H1,名称与品牌一致;
  4. H1 后有简短摘要,说明服务对象和核心价值;
  5. H2 分组不超过必要数量,命名可理解;
  6. 每个链接使用 Markdown 标准格式;
  7. 链接说明不是关键词堆砌,而是解释页面用途;
  8. 核心产品、价格、文档、案例或帮助页面被优先列出;
  9. 过期活动页、测试页、重复页未被放入核心区;
  10. 所有链接可访问,无 404、403、循环跳转;
  11. 文件内容与官网、文档、隐私和安全页面一致;
  12. 上线后保留同口径复测计划,记录 AI 回答变化。

如果你的目标是提高 AI 搜索可见性,还需要把 llms.txt 与结构化内容、权威信源、竞品对标一起看。MaxAEO 提供免费 AI 可见性诊断,输入官网域名约 60 秒即可生成首份包含提及率与核心结论的报告;深度监测则可继续追踪 AI 回答变化、引用来源和情绪趋势。

常见问题

llms.txt 合规检测和 llms.txt 校验工具一样吗?

不完全一样。校验工具通常检查格式、位置和链接可达;合规检测还应检查内容真实性、业务一致性、AI 是否采用以及后续复测结果。前者偏技术,后者偏可用性。

llms.txt 需要和 robots.txt 写在一起吗?

不需要。robots.txt 主要表达爬虫访问规则,llms.txt 主要提供 AI 可读的站点摘要和重要链接。两者可以互补,但不要把 robots 指令直接搬进 llms.txt。

没有 llms-full.txt 会影响合规吗?

通常不会直接导致不合规。llms-full.txt 更适合放更完整的文档或上下文,llms.txt 应保持精简。对中小型网站,先把 llms.txt 写准确,比急着扩展全文文件更重要。

llms.txt 上线后多久能看到 AI 搜索变化?

没有固定时间,也不应承诺几天见效。更稳妥的做法是先记录基线,再按同一批问题和平台持续复测。MaxAEO 的监测问题每天自动运行一次,各项指标与趋势曲线按天更新,适合观察上线后的方向性变化。

检测通过后还需要更新吗?

需要。产品、价格、定位、帮助文档或重要页面变化后,都应同步更新 llms.txt。建议把它纳入官网发布流程,而不是一次性配置后长期不管。

结论:合规检测的终点是可复测的 AI 认知

llms.txt 合规检测的最低线是文件可访问、结构可解析、链接可用;更高标准是内容可信、信源完整、AI 回答可复测。对 SaaS 和工具类品牌来说,llms.txt 不应只是“放一个文件”,而应成为 AI 搜索可见性管理的一环。

真正值得投入的检测结果,不是“通过/失败”两个字,而是一份可执行清单:哪些页面要补、哪些表述要改、哪些平台要复测、哪些引用来源要追踪。这样,llms.txt 才能从技术配置变成品牌在 AI 搜索中的稳定信号。