robots.txt AI爬虫要不要放行?GPTBot、ClaudeBot、Bytespider配置指南

robots.txt AI爬虫放行、部分放行与封禁的 VRC 决策树

作者:MaxAEO

如果目标是提高品牌在 AI 搜索中的可见度,建议采用以下默认策略:

  • 放行 AI 搜索机器人访问产品页、帮助文档、案例、博客和 FAQ。
  • 按内容授权决定是否放行训练机器人,不要把训练抓取与搜索引用混为一谈。
  • 对 Bytespider 等用途难以精确验证的机器人先做目录级测试,不要直接开放全站。
  • 账户、付费内容、个人信息和内部接口必须依靠鉴权保护,不能只写 robots.txt。

因此,封禁 GPTBot 并不等于退出 ChatGPT 搜索;允许 Bytespider,也不等于一定会获得豆包推荐。更基础的取舍可参考是否放行 GPTBot、豆包与 Perplexity 爬虫

什么是 robots.txt AI爬虫?

robots.txt AI爬虫,是网站通过根目录的 robots.txt,向 GPTBot、ClaudeBot 等自动抓取程序声明允许或禁止访问哪些 URL 路径。

讨论 AI 爬虫时,至少要区分四类用途:

类型 主要用途 代表性标识 robots.txt 能解决什么
模型改进或训练 获取可能用于改进模型的公开内容 GPTBot、ClaudeBot、Google-Extended 表达是否允许抓取或使用指定内容
AI 搜索抓取 建立搜索索引、获取答案来源 OAI-SearchBot、Claude-SearchBot、PerplexityBot 控制哪些公开页面可被搜索机器人访问
用户触发式获取 用户要求 AI 打开、总结或操作页面 ChatGPT-User、Claude-User 可表达偏好,但不能代替页面权限控制
用途难以精确验证 公开角色、数据流向或验证方式有限 Bytespider 等 只能先限制路径,再用日志和结果验证

OpenAI 的官方机器人说明明确区分 GPTBot、OAI-SearchBot 与 ChatGPT-User。Anthropic 也分别列出 ClaudeBot、Claude-SearchBot 和 Claude-User。只比较 GPTBot 与 ClaudeBot,会漏掉更接近 AI 搜索引用的抓取程序。具体差异可参考GPTBot、ClaudeBot 与 PerplexityBot 对比

robots.txt 使用的是公开的爬虫协商协议。RFC 9309定义了基本匹配规则,但该协议要求机器人自愿遵守,不是安全边界、版权合同或删除机制

GPTBot、ClaudeBot 和 Bytespider 应该放行吗?

没有适用于所有网站的统一答案。品牌官网通常应开放搜索型机器人;训练型机器人按授权模式决定;Bytespider 则适合先限制范围、验证收益。

机器人或标识 主要角色 对普通品牌官网的建议 需要注意
GPTBot 模型改进 可选放行;有版权或授权顾虑时封禁 封禁不等于退出 ChatGPT 搜索
OAI-SearchBot ChatGPT 搜索 放行公开、高价值页面 是否被抓取不保证一定获得引用
ChatGPT-User 用户触发式访问 公开页可访问,受限页必须鉴权 OpenAI 说明此类用户请求未必按普通爬虫方式处理
ClaudeBot 模型开发 按内容授权决定 不要与 Claude-SearchBot 混淆
Claude-SearchBot Claude 搜索 放行公开内容 仍需通过日志验证实际访问
Claude-User 用户触发式访问 公开页可访问,敏感页鉴权 robots.txt 不能承担权限管理
PerplexityBot AI 搜索抓取 以 AI 曝光为目标时放行公开内容 需监测引用而非只统计请求量
Google-Extended Google 生成式 AI 用途控制标识 按训练和使用授权决定 不影响网页在 Google 搜索中的收录和排名
Bytespider 与字节跳动相关的抓取程序 目录级开放或暂时封禁 不能仅凭名称推断其与豆包答案的关系

根据 Google 对 Google-Extended 的官方说明,选择退出 Google-Extended 不会影响网页在 Google 搜索结果中的收录或排名。它也不是一只可以单独从日志中识别的传统爬虫,而是用于 robots.txt 控制相关用途的产品标识。

GPTBot:训练许可与 ChatGPT 搜索是两件事

GPTBot 主要与模型改进有关,OAI-SearchBot 才更接近 ChatGPT 搜索中的网页发现和引用。

原创媒体、付费数据库或研究机构可以封禁 GPTBot,同时允许 OAI-SearchBot 读取以下内容:

  • 产品页和解决方案页;
  • 公开帮助文档;
  • 客户案例;
  • 新闻稿和品牌资料;
  • 可公开传播的研究摘要。

封禁 GPTBot 不会让模型立即遗忘已经获取的信息,也不会自动删除第三方网站对品牌的描述。

ClaudeBot:不要与 Claude-SearchBot 混用规则

ClaudeBot、Claude-SearchBot 和 Claude-User 的用途不同。企业可以允许 Claude-SearchBot 访问公开知识库,同时拒绝 ClaudeBot 抓取整站。

部署前应以 Anthropic 的网络爬虫控制说明核对最新名称和用途。机器人政策可能变化,不应长期依赖一份无人维护的静态名单。

Bytespider:先验证,不要把放行等同于豆包曝光

Bytespider 与字节跳动相关,但抓取发生、内容进入某个数据流程、品牌出现在豆包答案中,是三个不同事件

更稳妥的做法是:

  1. 只开放产品、品牌介绍、帮助中心和 FAQ。
  2. 封禁账户、搜索结果页、筛选参数页和高成本接口。
  3. 按厂商公布的方法验证请求身份;没有验证方法时,将 User-Agent 视为未验证信号。
  4. 观察四至八周的抓取成本、品牌提及和官网引用变化。
  5. 有明确收益再扩大范围,没有收益或成本过高则收紧。

如何用 VRC 模型决定每只 AI 爬虫的权限?

不要只做“整站放行或封禁”的二选一。更可审计的方法,是对每个“机器人 × 页面目录”分别评估曝光价值、权利风险和抓取成本。

MaxAEO 在本文采用 VRC 三轴模型。这是一个内部治理框架,并非行业标准,目的是让市场、法务和技术团队使用同一套可复算口径。

维度 0 分 1 分 2 分
V:曝光价值 几乎没有品牌价值 有助于发现或理解品牌 直接支持产品推荐、比较或购买决策
R:权利风险 自有且明确允许公开传播 含第三方、UGC 或授权边界不清 付费、个人信息、合同限制或明确禁止再利用
C:抓取成本 静态页面、缓存命中率高 有一定渲染或数据库开销 搜索、生成、复杂筛选或高成本接口

决策分为:

2V - 2R - C

**先执行硬性规则:只要 R=2,就不应依赖评分决定开放,而应直接鉴权或封禁。**其余页面可按下表处理:

决策分 建议 实施方式
≥ 2 放行 开放指定目录并记录日志
0 至 1 有限放行 只开放高价值路径,配合缓存和限流
≤ -1 封禁或小流量测试 robots.txt 拒绝,并用服务端控制高成本访问

演算示例:

机器人 × 路径 V R C 结果 建议
OAI-SearchBot × /docs/ 2 0 0 4 放行
GPTBot × /blog/ 1 0 0 2 愿意授权训练时放行
GPTBot × /reports/paid/ 1 2 0 硬性拦截 鉴权并封禁
Bytespider × /search/ 1 1 2 -2 封禁或限流测试
Claude-SearchBot × /cases/ 2 0 1 3 放行

这个模型的关键不是分数本身,而是把决策粒度从“某只机器人”缩小到“某只机器人访问某类页面”。更完整的逐机器人策略可参考AI 爬虫放行决策指南

robots.txt AI爬虫放行、部分放行与封禁的 VRC 决策树

不同类型的网站应采用什么默认策略?

内容授权模式决定底线,AI 可见度目标决定开放范围,服务器成本决定限流强度。

网站类型 训练型机器人 AI 搜索机器人 Bytespider 主要原因
品牌官网、SaaS 官网 可选放行 放行公开页 目录级测试 产品被发现和引用的潜在价值较高
电商品牌 开放商品和指南,封禁用户数据 放行商品、分类和指南页 目录级测试 有利于商品比较,但需控制筛选页抓取
新闻、出版、付费研究 默认封禁 只开放摘要和免费内容 默认封禁 内容替代风险和授权要求较高
开源文档、公共知识库 通常放行 放行 放行并限流 传播和采用通常是首要目标
UGC 社区 谨慎或封禁 只开放允许公开索引的内容 谨慎 用户授权、隐私和内容质量更复杂
医疗、金融或法律平台 按合规要求决定 只开放经过审核的公开内容 默认谨慎 错误引用和敏感数据风险更高

如果某个页面本身不适合匿名用户访问,就不该用 robots.txt 补救。将 /confidential-report/ 写进公开文件,反而可能暴露敏感路径。

robots.txt AI爬虫规则应该怎么写?

先盘点目录,再按机器人用途分组,最后用日志验证。规则的上下顺序通常不代表优先级,真正起作用的是 User-Agent 分组和路径匹配的具体程度。

第一步:建立路径清单

建议先把页面分为三组:

  1. **优先开放:**产品、解决方案、帮助文档、案例、品牌介绍、博客和 FAQ。
  2. **条件开放:**研究摘要、商品筛选页、公开 API、UGC 页面。
  3. **禁止匿名访问:**账户、订单、个人信息、付费正文、内部搜索和管理接口。

第二步:部署保守型默认规则

下面的配置适合希望获得 AI 搜索曝光,但暂时不愿开放模型训练内容的品牌网站:

# AI 搜索机器人:允许抓取公开页面
User-agent: OAI-SearchBot
Allow: /
Disallow: /account/
Disallow: /checkout/
Disallow: /search/
Disallow: /api/private/

User-agent: Claude-SearchBot
Allow: /
Disallow: /account/
Disallow: /checkout/
Disallow: /search/
Disallow: /api/private/

User-agent: PerplexityBot
Allow: /
Disallow: /account/
Disallow: /checkout/
Disallow: /search/
Disallow: /api/private/

# 模型训练或改进:默认拒绝
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# 用途或收益尚未验证:只开放指定目录
User-agent: Bytespider
Disallow: /
Allow: /products/
Allow: /help/
Allow: /blog/

如果企业愿意授权 GPTBot 或 ClaudeBot 访问公开资料,可以将对应规则改成目录级开放:

User-agent: GPTBot
Disallow: /
Allow: /products/
Allow: /docs/
Allow: /blog/

User-agent: ClaudeBot
Disallow: /
Allow: /products/
Allow: /docs/
Allow: /blog/

第三步:检查语法和部署位置

根据 Google 的 robots.txt 规范说明,上线时至少检查以下问题:

  • 文件位于站点根目录,例如 https://example.com/robots.txt
  • example.comwww.example.comdocs.example.com 分别维护自己的规则。
  • URL 路径通常区分大小写,/Docs//docs/ 可能不是同一路径。
  • AllowDisallow 冲突时,通常由匹配路径的具体程度决定,而非书写顺序。
  • 不要在 robots.txt 中写 Noindex;它不是 RFC 9309 定义的有效规则。
  • Crawl-delay 并非所有机器人都支持,成本控制应交给 CDN、缓存、WAF 和服务器限流。
  • 不要依赖未经目标机器人文档确认的通配符或扩展语法。

如何验证规则真的生效?

有效验证需要同时证明三件事:文件可读取、真实机器人遵守规则、开放后产生了可衡量的业务结果。

1. 验证服务器响应

先检查 robots.txt 和目标页面:

curl -I https://example.com/robots.txt
curl -A "OAI-SearchBot" -I https://example.com/docs/example
curl -A "GPTBot" -I https://example.com/reports/paid/example

这些命令只能验证服务器对指定 User-Agent 的响应,不能证明请求来自真实机器人,也不能证明机器人会遵守 robots.txt

2. 验证请求身份

User-Agent 是普通请求头,可以被伪造。正式分析前应:

  • 使用厂商公布的 IP 范围或验证方法;
  • 记录源 IP、User-Agent、请求路径、状态码和时间;
  • 将无法验证的请求单独归类;
  • 不要仅凭包含 GPTBotClaudeBotBytespider 的字符串统计流量。

3. 检查页面是否真的可抓取

即使 robots.txt 放行,页面仍可能因为以下问题无法被 AI 爬虫读取:

  • WAF 或 CDN 返回 403、429;
  • 地域或 ASN 规则拦截厂商 IP;
  • 页面只能在登录后访问;
  • 正文依赖客户端 JavaScript,初始 HTML 几乎为空;
  • canonical、重定向或状态码配置错误;
  • 页面加载依赖被 robots.txt 禁止的脚本或接口。

复杂站点可按AI 爬虫可访问性诊断流程逐层排查,避免把“robots.txt 已放行”和“内容可被读取”误认为一回事。

如何判断放行后有没有提高 AI 可见度?

至少要同时观察抓取、引用和品牌答案三条证据链。只有访问日志,不能证明 AI 搜索表现改善。

指标 计算方法 说明
验证抓取成功率 已验证机器人返回 2xx 或 304 的请求 ÷ 已验证请求 判断技术开放是否生效
AI 提及率 提及品牌的有效回答 ÷ 全部有效回答 衡量品牌进入答案的频率
官网引用率 引用自有域名的有效回答 ÷ 全部有效回答 衡量官网是否成为证据来源
前三推荐占比 品牌位于有序推荐前三的回答 ÷ 有序推荐回答 衡量推荐位置
单千次抓取成本 AI 请求产生的带宽与计算成本 ÷ 请求数 × 1000 判断开放是否经济

推荐的四至八周验证方法

  1. 固定一组与产品、竞品和购买决策相关的 Prompt。
  2. 固定监测平台、语言、地区和登录状态。
  3. 记录变更前至少四周的抓取、提及和引用基线。
  4. 只调整一个机器人或一个目录,避免同时改内容、内链和 robots.txt。
  5. 保留一组未调整的相似页面作为对照。
  6. 变更后使用相同口径再观察四至八周。
  7. 记录模型或产品版本变化,防止把平台更新误认为配置效果。

可以使用差分法减少误判:

净变化 = 实验目录的引用率变化 - 对照目录的引用率变化

假设开放 /docs/ 后,其官网引用率从 3% 升至 7%,增加 4 个百分点;同期未调整的 /blog/ 从 4% 升至 5%,增加 1 个百分点。此次调整对应的净变化为 3 个百分点。这仍不能单独证明因果关系,但比简单比较前后数字更可靠。

服务器日志中 AI 爬虫 User-Agent、验证结果、状态码和访问路径示意

robots.txt、llms.txt 和访问控制有什么区别?

robots.txt 管抓取许可,llms.txt 提供内容入口,鉴权和 WAF 才负责强制保护。三者不能互相替代。

机制 主要作用 能否强制阻止访问 主要限制
robots.txt 声明机器人允许或禁止抓取的路径 依赖机器人自愿遵守
llms.txt 向 AI 系统提供推荐内容和结构化入口 采用情况不一致,不能覆盖 robots.txt
meta robots / X-Robots-Tag 向支持该指令的搜索系统表达索引偏好 爬虫必须先访问页面才能读取
登录、服务端鉴权 保护付费、私有和个人数据 需要正确实施权限逻辑
WAF、限流、CDN 缓存 控制异常访问和服务器成本 规则过严可能误伤真实机器人

有关两种文件的具体边界,可参考llms.txt 与 robots.txt 的区别

哪些错误最容易导致误判?

  • **把 GPTBot 当成 ChatGPT 搜索机器人:**封禁 GPTBot 后,品牌仍可能出现在 ChatGPT 搜索中。
  • **把放行等同于获得引用:**抓取成功只是必要条件之一,不是推荐或引用承诺。
  • **用 robots.txt 保护机密信息:**恶意程序可以忽略规则,敏感内容必须鉴权。
  • **在 robots.txt 中写 Noindex:**该写法不是标准索引控制方式。
  • **封禁正文依赖的资源:**脚本、接口或样式被拦截后,页面可能无法完整解析。
  • **只看 User-Agent:**伪造流量会夸大 AI 抓取量和服务器成本。
  • **在错误的主机上配置:**主域名的规则不会自动覆盖独立子域名。
  • **依赖 Crawl-delay 控制成本:**机器人支持情况不同,应使用服务端限流。
  • **发布后不留变更记录:**无法判断问题来自 robots.txt、WAF、内容更新还是平台变化。

发布前检查清单

  • 已区分训练、AI 搜索和用户触发式机器人。
  • 已按“机器人 × 页面目录”评估权限,而非只做整站决策。
  • 已确认内容版权、客户协议和个人信息要求。
  • 付费或私有内容已经配置服务端鉴权。
  • robots.txt 未暴露不必要的敏感路径名称。
  • 每个子域名都部署了对应规则。
  • WAF、CDN 缓存和速率限制已经配置。
  • 已验证 robots.txt 返回 200 且内容可解析。
  • 已建立变更前的日志、提及率和官网引用率基线。
  • 已准备固定 Prompt、对照页面和四至八周观察窗口。
  • 发现成本上升或异常抓取时可以快速回滚。
  • 已安排至少每季度复核机器人名称和官方政策。

常见问题

封禁 GPTBot 会让品牌从 ChatGPT 中消失吗?

不会。GPTBot 主要涉及模型改进,ChatGPT 搜索还可能使用 OAI-SearchBot、第三方搜索索引、既有数据和其他公开来源。封禁 GPTBot 也不会自动删除模型此前获得的信息。

放行 Bytespider 能提高豆包品牌推荐概率吗?

不能保证。放行只能消除一种潜在的内容获取障碍,无法证明豆包会使用该次抓取,也无法保证品牌进入推荐结果。应同时监测已验证请求、品牌提及率和官网引用率。

Disallow: / 足以保护付费内容吗?

不足。robots.txt 是自愿遵守的爬虫协议,不是访问控制。付费内容必须使用登录、订阅权限、签名链接或服务端鉴权,必要时再配合 WAF 和速率限制。

llms.txt 能代替 robots.txt 吗?

不能。robots.txt 用于表达抓取许可,llms.txt 用于提供内容结构和推荐入口。llms.txt 不能覆盖 robots.txt,也不能代替版权协议、身份验证或服务器安全控制。

封禁 Google-Extended 会影响 Google 排名吗?

robots.txt 放行后多久能看到效果?

没有固定时间。抓取频率、内容质量、平台数据源和品牌外部声量都会影响结果。建议至少使用固定 Prompt 和对照页面观察四至八周,并把机器人或平台政策变化记录在同一时间线上。

{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "Article",
      "headline": "robots.txt AI爬虫要不要放行?GPTBot、ClaudeBot、Bytespider配置指南",
      "description": "robots.txt AI爬虫应如何设置?本文区分训练、AI搜索和用户触发机器人,对比 GPTBot、ClaudeBot、Bytespider,提供可复制的配置规则、决策框架和验证方法。",
      "inLanguage": "zh-CN",
      "keywords": [
        "robots.txt AI爬虫",
        "GPTBot robots.txt",
        "ClaudeBot robots.txt",
        "Bytespider robots.txt",
        "AI爬虫放行"
      ],
      "author": {
        "@type": "Organization",
        "name": "MaxAEO",
        "url": "https://maxaeo.cn/"
      },
      "publisher": {
        "@type": "Organization",
        "name": "MaxAEO",
        "url": "https://maxaeo.cn/"
      },
      "datePublished": "2026-07-13",
      "dateModified": "2026-07-13"
    },
    {
      "@type": "FAQPage",
      "mainEntity": [
        {
          "@type": "Question",
          "name": "封禁 GPTBot 会让品牌从 ChatGPT 中消失吗?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "不会。GPTBot 主要涉及模型改进,ChatGPT 搜索还可能使用 OAI-SearchBot、第三方搜索索引、既有数据和其他公开来源。封禁 GPTBot 也不会自动删除模型此前获得的信息。"
          }
        },
        {
          "@type": "Question",
          "name": "放行 Bytespider 能提高豆包品牌推荐概率吗?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "不能保证。放行只能消除一种潜在的内容获取障碍,无法证明豆包会使用该次抓取,也无法保证品牌进入推荐结果。应同时监测已验证请求、品牌提及率和官网引用率。"
          }
        },
        {
          "@type": "Question",
          "name": "Disallow: / 足以保护付费内容吗?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "不足。robots.txt 是自愿遵守的爬虫协议,不是访问控制。付费内容必须使用登录、订阅权限、签名链接或服务端鉴权,必要时再配合 WAF 和速率限制。"
          }
        },
        {
          "@type": "Question",
          "name": "llms.txt 能代替 robots.txt 吗?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "不能。robots.txt 用于表达抓取许可,llms.txt 用于提供内容结构和推荐入口。llms.txt 不能覆盖 robots.txt,也不能代替版权协议、身份验证或服务器安全控制。"
          }
        },
        {
          "@type": "Question",
          "name": "封禁 Google-Extended 会影响 Google 排名吗?",
          "acceptedAnswer": {
            "@type": "Answer",
          }
        },
        {
          "@type": "Question",
          "name": "robots.txt 放行后多久能看到效果?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "没有固定时间。建议至少使用固定 Prompt 和对照页面观察四至八周,并同时记录抓取、官网引用、品牌提及及机器人政策变化。"
          }
        }
      ]
    }
  ]
}