作者:MaxAEO
如果目标是提高品牌在 AI 搜索中的可见度,建议采用以下默认策略:
- 放行 AI 搜索机器人访问产品页、帮助文档、案例、博客和 FAQ。
- 按内容授权决定是否放行训练机器人,不要把训练抓取与搜索引用混为一谈。
- 对 Bytespider 等用途难以精确验证的机器人先做目录级测试,不要直接开放全站。
- 账户、付费内容、个人信息和内部接口必须依靠鉴权保护,不能只写 robots.txt。
因此,封禁 GPTBot 并不等于退出 ChatGPT 搜索;允许 Bytespider,也不等于一定会获得豆包推荐。更基础的取舍可参考是否放行 GPTBot、豆包与 Perplexity 爬虫。
什么是 robots.txt AI爬虫?
robots.txt AI爬虫,是网站通过根目录的 robots.txt,向 GPTBot、ClaudeBot 等自动抓取程序声明允许或禁止访问哪些 URL 路径。
讨论 AI 爬虫时,至少要区分四类用途:
| 类型 | 主要用途 | 代表性标识 | robots.txt 能解决什么 |
|---|---|---|---|
| 模型改进或训练 | 获取可能用于改进模型的公开内容 | GPTBot、ClaudeBot、Google-Extended | 表达是否允许抓取或使用指定内容 |
| AI 搜索抓取 | 建立搜索索引、获取答案来源 | OAI-SearchBot、Claude-SearchBot、PerplexityBot | 控制哪些公开页面可被搜索机器人访问 |
| 用户触发式获取 | 用户要求 AI 打开、总结或操作页面 | ChatGPT-User、Claude-User | 可表达偏好,但不能代替页面权限控制 |
| 用途难以精确验证 | 公开角色、数据流向或验证方式有限 | Bytespider 等 | 只能先限制路径,再用日志和结果验证 |
OpenAI 的官方机器人说明明确区分 GPTBot、OAI-SearchBot 与 ChatGPT-User。Anthropic 也分别列出 ClaudeBot、Claude-SearchBot 和 Claude-User。只比较 GPTBot 与 ClaudeBot,会漏掉更接近 AI 搜索引用的抓取程序。具体差异可参考GPTBot、ClaudeBot 与 PerplexityBot 对比。
robots.txt 使用的是公开的爬虫协商协议。RFC 9309定义了基本匹配规则,但该协议要求机器人自愿遵守,不是安全边界、版权合同或删除机制。
GPTBot、ClaudeBot 和 Bytespider 应该放行吗?
没有适用于所有网站的统一答案。品牌官网通常应开放搜索型机器人;训练型机器人按授权模式决定;Bytespider 则适合先限制范围、验证收益。
| 机器人或标识 | 主要角色 | 对普通品牌官网的建议 | 需要注意 |
|---|---|---|---|
| GPTBot | 模型改进 | 可选放行;有版权或授权顾虑时封禁 | 封禁不等于退出 ChatGPT 搜索 |
| OAI-SearchBot | ChatGPT 搜索 | 放行公开、高价值页面 | 是否被抓取不保证一定获得引用 |
| ChatGPT-User | 用户触发式访问 | 公开页可访问,受限页必须鉴权 | OpenAI 说明此类用户请求未必按普通爬虫方式处理 |
| ClaudeBot | 模型开发 | 按内容授权决定 | 不要与 Claude-SearchBot 混淆 |
| Claude-SearchBot | Claude 搜索 | 放行公开内容 | 仍需通过日志验证实际访问 |
| Claude-User | 用户触发式访问 | 公开页可访问,敏感页鉴权 | robots.txt 不能承担权限管理 |
| PerplexityBot | AI 搜索抓取 | 以 AI 曝光为目标时放行公开内容 | 需监测引用而非只统计请求量 |
| Google-Extended | Google 生成式 AI 用途控制标识 | 按训练和使用授权决定 | 不影响网页在 Google 搜索中的收录和排名 |
| Bytespider | 与字节跳动相关的抓取程序 | 目录级开放或暂时封禁 | 不能仅凭名称推断其与豆包答案的关系 |
根据 Google 对 Google-Extended 的官方说明,选择退出 Google-Extended 不会影响网页在 Google 搜索结果中的收录或排名。它也不是一只可以单独从日志中识别的传统爬虫,而是用于 robots.txt 控制相关用途的产品标识。
GPTBot:训练许可与 ChatGPT 搜索是两件事
GPTBot 主要与模型改进有关,OAI-SearchBot 才更接近 ChatGPT 搜索中的网页发现和引用。
原创媒体、付费数据库或研究机构可以封禁 GPTBot,同时允许 OAI-SearchBot 读取以下内容:
- 产品页和解决方案页;
- 公开帮助文档;
- 客户案例;
- 新闻稿和品牌资料;
- 可公开传播的研究摘要。
封禁 GPTBot 不会让模型立即遗忘已经获取的信息,也不会自动删除第三方网站对品牌的描述。
ClaudeBot:不要与 Claude-SearchBot 混用规则
ClaudeBot、Claude-SearchBot 和 Claude-User 的用途不同。企业可以允许 Claude-SearchBot 访问公开知识库,同时拒绝 ClaudeBot 抓取整站。
部署前应以 Anthropic 的网络爬虫控制说明核对最新名称和用途。机器人政策可能变化,不应长期依赖一份无人维护的静态名单。
Bytespider:先验证,不要把放行等同于豆包曝光
Bytespider 与字节跳动相关,但抓取发生、内容进入某个数据流程、品牌出现在豆包答案中,是三个不同事件。
更稳妥的做法是:
- 只开放产品、品牌介绍、帮助中心和 FAQ。
- 封禁账户、搜索结果页、筛选参数页和高成本接口。
- 按厂商公布的方法验证请求身份;没有验证方法时,将 User-Agent 视为未验证信号。
- 观察四至八周的抓取成本、品牌提及和官网引用变化。
- 有明确收益再扩大范围,没有收益或成本过高则收紧。
如何用 VRC 模型决定每只 AI 爬虫的权限?
不要只做“整站放行或封禁”的二选一。更可审计的方法,是对每个“机器人 × 页面目录”分别评估曝光价值、权利风险和抓取成本。
MaxAEO 在本文采用 VRC 三轴模型。这是一个内部治理框架,并非行业标准,目的是让市场、法务和技术团队使用同一套可复算口径。
| 维度 | 0 分 | 1 分 | 2 分 |
|---|---|---|---|
| V:曝光价值 | 几乎没有品牌价值 | 有助于发现或理解品牌 | 直接支持产品推荐、比较或购买决策 |
| R:权利风险 | 自有且明确允许公开传播 | 含第三方、UGC 或授权边界不清 | 付费、个人信息、合同限制或明确禁止再利用 |
| C:抓取成本 | 静态页面、缓存命中率高 | 有一定渲染或数据库开销 | 搜索、生成、复杂筛选或高成本接口 |
决策分为:
2V - 2R - C
**先执行硬性规则:只要 R=2,就不应依赖评分决定开放,而应直接鉴权或封禁。**其余页面可按下表处理:
| 决策分 | 建议 | 实施方式 |
|---|---|---|
| ≥ 2 | 放行 | 开放指定目录并记录日志 |
| 0 至 1 | 有限放行 | 只开放高价值路径,配合缓存和限流 |
| ≤ -1 | 封禁或小流量测试 | robots.txt 拒绝,并用服务端控制高成本访问 |
演算示例:
| 机器人 × 路径 | V | R | C | 结果 | 建议 |
|---|---|---|---|---|---|
OAI-SearchBot × /docs/ |
2 | 0 | 0 | 4 | 放行 |
GPTBot × /blog/ |
1 | 0 | 0 | 2 | 愿意授权训练时放行 |
GPTBot × /reports/paid/ |
1 | 2 | 0 | 硬性拦截 | 鉴权并封禁 |
Bytespider × /search/ |
1 | 1 | 2 | -2 | 封禁或限流测试 |
Claude-SearchBot × /cases/ |
2 | 0 | 1 | 3 | 放行 |
这个模型的关键不是分数本身,而是把决策粒度从“某只机器人”缩小到“某只机器人访问某类页面”。更完整的逐机器人策略可参考AI 爬虫放行决策指南。

不同类型的网站应采用什么默认策略?
内容授权模式决定底线,AI 可见度目标决定开放范围,服务器成本决定限流强度。
| 网站类型 | 训练型机器人 | AI 搜索机器人 | Bytespider | 主要原因 |
|---|---|---|---|---|
| 品牌官网、SaaS 官网 | 可选放行 | 放行公开页 | 目录级测试 | 产品被发现和引用的潜在价值较高 |
| 电商品牌 | 开放商品和指南,封禁用户数据 | 放行商品、分类和指南页 | 目录级测试 | 有利于商品比较,但需控制筛选页抓取 |
| 新闻、出版、付费研究 | 默认封禁 | 只开放摘要和免费内容 | 默认封禁 | 内容替代风险和授权要求较高 |
| 开源文档、公共知识库 | 通常放行 | 放行 | 放行并限流 | 传播和采用通常是首要目标 |
| UGC 社区 | 谨慎或封禁 | 只开放允许公开索引的内容 | 谨慎 | 用户授权、隐私和内容质量更复杂 |
| 医疗、金融或法律平台 | 按合规要求决定 | 只开放经过审核的公开内容 | 默认谨慎 | 错误引用和敏感数据风险更高 |
如果某个页面本身不适合匿名用户访问,就不该用 robots.txt 补救。将 /confidential-report/ 写进公开文件,反而可能暴露敏感路径。
robots.txt AI爬虫规则应该怎么写?
先盘点目录,再按机器人用途分组,最后用日志验证。规则的上下顺序通常不代表优先级,真正起作用的是 User-Agent 分组和路径匹配的具体程度。
第一步:建立路径清单
建议先把页面分为三组:
- **优先开放:**产品、解决方案、帮助文档、案例、品牌介绍、博客和 FAQ。
- **条件开放:**研究摘要、商品筛选页、公开 API、UGC 页面。
- **禁止匿名访问:**账户、订单、个人信息、付费正文、内部搜索和管理接口。
第二步:部署保守型默认规则
下面的配置适合希望获得 AI 搜索曝光,但暂时不愿开放模型训练内容的品牌网站:
# AI 搜索机器人:允许抓取公开页面
User-agent: OAI-SearchBot
Allow: /
Disallow: /account/
Disallow: /checkout/
Disallow: /search/
Disallow: /api/private/
User-agent: Claude-SearchBot
Allow: /
Disallow: /account/
Disallow: /checkout/
Disallow: /search/
Disallow: /api/private/
User-agent: PerplexityBot
Allow: /
Disallow: /account/
Disallow: /checkout/
Disallow: /search/
Disallow: /api/private/
# 模型训练或改进:默认拒绝
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# 用途或收益尚未验证:只开放指定目录
User-agent: Bytespider
Disallow: /
Allow: /products/
Allow: /help/
Allow: /blog/
如果企业愿意授权 GPTBot 或 ClaudeBot 访问公开资料,可以将对应规则改成目录级开放:
User-agent: GPTBot
Disallow: /
Allow: /products/
Allow: /docs/
Allow: /blog/
User-agent: ClaudeBot
Disallow: /
Allow: /products/
Allow: /docs/
Allow: /blog/
第三步:检查语法和部署位置
根据 Google 的 robots.txt 规范说明,上线时至少检查以下问题:
- 文件位于站点根目录,例如
https://example.com/robots.txt。 example.com、www.example.com和docs.example.com分别维护自己的规则。- URL 路径通常区分大小写,
/Docs/与/docs/可能不是同一路径。 Allow与Disallow冲突时,通常由匹配路径的具体程度决定,而非书写顺序。- 不要在 robots.txt 中写
Noindex;它不是 RFC 9309 定义的有效规则。 Crawl-delay并非所有机器人都支持,成本控制应交给 CDN、缓存、WAF 和服务器限流。- 不要依赖未经目标机器人文档确认的通配符或扩展语法。
如何验证规则真的生效?
有效验证需要同时证明三件事:文件可读取、真实机器人遵守规则、开放后产生了可衡量的业务结果。
1. 验证服务器响应
先检查 robots.txt 和目标页面:
curl -I https://example.com/robots.txt
curl -A "OAI-SearchBot" -I https://example.com/docs/example
curl -A "GPTBot" -I https://example.com/reports/paid/example
这些命令只能验证服务器对指定 User-Agent 的响应,不能证明请求来自真实机器人,也不能证明机器人会遵守 robots.txt。
2. 验证请求身份
User-Agent 是普通请求头,可以被伪造。正式分析前应:
- 使用厂商公布的 IP 范围或验证方法;
- 记录源 IP、User-Agent、请求路径、状态码和时间;
- 将无法验证的请求单独归类;
- 不要仅凭包含
GPTBot、ClaudeBot或Bytespider的字符串统计流量。
3. 检查页面是否真的可抓取
即使 robots.txt 放行,页面仍可能因为以下问题无法被 AI 爬虫读取:
- WAF 或 CDN 返回 403、429;
- 地域或 ASN 规则拦截厂商 IP;
- 页面只能在登录后访问;
- 正文依赖客户端 JavaScript,初始 HTML 几乎为空;
- canonical、重定向或状态码配置错误;
- 页面加载依赖被 robots.txt 禁止的脚本或接口。
复杂站点可按AI 爬虫可访问性诊断流程逐层排查,避免把“robots.txt 已放行”和“内容可被读取”误认为一回事。
如何判断放行后有没有提高 AI 可见度?
至少要同时观察抓取、引用和品牌答案三条证据链。只有访问日志,不能证明 AI 搜索表现改善。
| 指标 | 计算方法 | 说明 |
|---|---|---|
| 验证抓取成功率 | 已验证机器人返回 2xx 或 304 的请求 ÷ 已验证请求 | 判断技术开放是否生效 |
| AI 提及率 | 提及品牌的有效回答 ÷ 全部有效回答 | 衡量品牌进入答案的频率 |
| 官网引用率 | 引用自有域名的有效回答 ÷ 全部有效回答 | 衡量官网是否成为证据来源 |
| 前三推荐占比 | 品牌位于有序推荐前三的回答 ÷ 有序推荐回答 | 衡量推荐位置 |
| 单千次抓取成本 | AI 请求产生的带宽与计算成本 ÷ 请求数 × 1000 | 判断开放是否经济 |
推荐的四至八周验证方法
- 固定一组与产品、竞品和购买决策相关的 Prompt。
- 固定监测平台、语言、地区和登录状态。
- 记录变更前至少四周的抓取、提及和引用基线。
- 只调整一个机器人或一个目录,避免同时改内容、内链和 robots.txt。
- 保留一组未调整的相似页面作为对照。
- 变更后使用相同口径再观察四至八周。
- 记录模型或产品版本变化,防止把平台更新误认为配置效果。
可以使用差分法减少误判:
净变化 = 实验目录的引用率变化 - 对照目录的引用率变化
假设开放 /docs/ 后,其官网引用率从 3% 升至 7%,增加 4 个百分点;同期未调整的 /blog/ 从 4% 升至 5%,增加 1 个百分点。此次调整对应的净变化为 3 个百分点。这仍不能单独证明因果关系,但比简单比较前后数字更可靠。

robots.txt、llms.txt 和访问控制有什么区别?
robots.txt 管抓取许可,llms.txt 提供内容入口,鉴权和 WAF 才负责强制保护。三者不能互相替代。
| 机制 | 主要作用 | 能否强制阻止访问 | 主要限制 |
|---|---|---|---|
| robots.txt | 声明机器人允许或禁止抓取的路径 | 否 | 依赖机器人自愿遵守 |
| llms.txt | 向 AI 系统提供推荐内容和结构化入口 | 否 | 采用情况不一致,不能覆盖 robots.txt |
| meta robots / X-Robots-Tag | 向支持该指令的搜索系统表达索引偏好 | 否 | 爬虫必须先访问页面才能读取 |
| 登录、服务端鉴权 | 保护付费、私有和个人数据 | 是 | 需要正确实施权限逻辑 |
| WAF、限流、CDN 缓存 | 控制异常访问和服务器成本 | 是 | 规则过严可能误伤真实机器人 |
有关两种文件的具体边界,可参考llms.txt 与 robots.txt 的区别。
哪些错误最容易导致误判?
- **把 GPTBot 当成 ChatGPT 搜索机器人:**封禁 GPTBot 后,品牌仍可能出现在 ChatGPT 搜索中。
- **把放行等同于获得引用:**抓取成功只是必要条件之一,不是推荐或引用承诺。
- **用 robots.txt 保护机密信息:**恶意程序可以忽略规则,敏感内容必须鉴权。
- **在 robots.txt 中写
Noindex:**该写法不是标准索引控制方式。 - **封禁正文依赖的资源:**脚本、接口或样式被拦截后,页面可能无法完整解析。
- **只看 User-Agent:**伪造流量会夸大 AI 抓取量和服务器成本。
- **在错误的主机上配置:**主域名的规则不会自动覆盖独立子域名。
- **依赖
Crawl-delay控制成本:**机器人支持情况不同,应使用服务端限流。 - **发布后不留变更记录:**无法判断问题来自 robots.txt、WAF、内容更新还是平台变化。
发布前检查清单
- 已区分训练、AI 搜索和用户触发式机器人。
- 已按“机器人 × 页面目录”评估权限,而非只做整站决策。
- 已确认内容版权、客户协议和个人信息要求。
- 付费或私有内容已经配置服务端鉴权。
- robots.txt 未暴露不必要的敏感路径名称。
- 每个子域名都部署了对应规则。
- WAF、CDN 缓存和速率限制已经配置。
- 已验证 robots.txt 返回 200 且内容可解析。
- 已建立变更前的日志、提及率和官网引用率基线。
- 已准备固定 Prompt、对照页面和四至八周观察窗口。
- 发现成本上升或异常抓取时可以快速回滚。
- 已安排至少每季度复核机器人名称和官方政策。
常见问题
封禁 GPTBot 会让品牌从 ChatGPT 中消失吗?
不会。GPTBot 主要涉及模型改进,ChatGPT 搜索还可能使用 OAI-SearchBot、第三方搜索索引、既有数据和其他公开来源。封禁 GPTBot 也不会自动删除模型此前获得的信息。
放行 Bytespider 能提高豆包品牌推荐概率吗?
不能保证。放行只能消除一种潜在的内容获取障碍,无法证明豆包会使用该次抓取,也无法保证品牌进入推荐结果。应同时监测已验证请求、品牌提及率和官网引用率。
Disallow: / 足以保护付费内容吗?
不足。robots.txt 是自愿遵守的爬虫协议,不是访问控制。付费内容必须使用登录、订阅权限、签名链接或服务端鉴权,必要时再配合 WAF 和速率限制。
llms.txt 能代替 robots.txt 吗?
不能。robots.txt 用于表达抓取许可,llms.txt 用于提供内容结构和推荐入口。llms.txt 不能覆盖 robots.txt,也不能代替版权协议、身份验证或服务器安全控制。
封禁 Google-Extended 会影响 Google 排名吗?
robots.txt 放行后多久能看到效果?
没有固定时间。抓取频率、内容质量、平台数据源和品牌外部声量都会影响结果。建议至少使用固定 Prompt 和对照页面观察四至八周,并把机器人或平台政策变化记录在同一时间线上。
{
"@context": "https://schema.org",
"@graph": [
{
"@type": "Article",
"headline": "robots.txt AI爬虫要不要放行?GPTBot、ClaudeBot、Bytespider配置指南",
"description": "robots.txt AI爬虫应如何设置?本文区分训练、AI搜索和用户触发机器人,对比 GPTBot、ClaudeBot、Bytespider,提供可复制的配置规则、决策框架和验证方法。",
"inLanguage": "zh-CN",
"keywords": [
"robots.txt AI爬虫",
"GPTBot robots.txt",
"ClaudeBot robots.txt",
"Bytespider robots.txt",
"AI爬虫放行"
],
"author": {
"@type": "Organization",
"name": "MaxAEO",
"url": "https://maxaeo.cn/"
},
"publisher": {
"@type": "Organization",
"name": "MaxAEO",
"url": "https://maxaeo.cn/"
},
"datePublished": "2026-07-13",
"dateModified": "2026-07-13"
},
{
"@type": "FAQPage",
"mainEntity": [
{
"@type": "Question",
"name": "封禁 GPTBot 会让品牌从 ChatGPT 中消失吗?",
"acceptedAnswer": {
"@type": "Answer",
"text": "不会。GPTBot 主要涉及模型改进,ChatGPT 搜索还可能使用 OAI-SearchBot、第三方搜索索引、既有数据和其他公开来源。封禁 GPTBot 也不会自动删除模型此前获得的信息。"
}
},
{
"@type": "Question",
"name": "放行 Bytespider 能提高豆包品牌推荐概率吗?",
"acceptedAnswer": {
"@type": "Answer",
"text": "不能保证。放行只能消除一种潜在的内容获取障碍,无法证明豆包会使用该次抓取,也无法保证品牌进入推荐结果。应同时监测已验证请求、品牌提及率和官网引用率。"
}
},
{
"@type": "Question",
"name": "Disallow: / 足以保护付费内容吗?",
"acceptedAnswer": {
"@type": "Answer",
"text": "不足。robots.txt 是自愿遵守的爬虫协议,不是访问控制。付费内容必须使用登录、订阅权限、签名链接或服务端鉴权,必要时再配合 WAF 和速率限制。"
}
},
{
"@type": "Question",
"name": "llms.txt 能代替 robots.txt 吗?",
"acceptedAnswer": {
"@type": "Answer",
"text": "不能。robots.txt 用于表达抓取许可,llms.txt 用于提供内容结构和推荐入口。llms.txt 不能覆盖 robots.txt,也不能代替版权协议、身份验证或服务器安全控制。"
}
},
{
"@type": "Question",
"name": "封禁 Google-Extended 会影响 Google 排名吗?",
"acceptedAnswer": {
"@type": "Answer",
}
},
{
"@type": "Question",
"name": "robots.txt 放行后多久能看到效果?",
"acceptedAnswer": {
"@type": "Answer",
"text": "没有固定时间。建议至少使用固定 Prompt 和对照页面观察四至八周,并同时记录抓取、官网引用、品牌提及及机器人政策变化。"
}
}
]
}
]
}