AI 爬虫 robots 怎么配:GPTBot、豆包、Perplexity 放行还是屏蔽

AI 爬虫 robots 放行与屏蔽决策的三类框架示意图

AI 爬虫 robots 配置的核心结论先给你:别一刀切「全放」或「全封」。该把 AI 爬虫按职能分成训练、实时检索、用户触发三类,分别决策——屏蔽训练类几乎不影响你在 AI 搜索里的可见度;但屏蔽实时检索类,等于亲手把品牌从 DeepSeek、豆包、ChatGPT、Perplexity 的答案里删掉。下面逐个爬虫拆开讲,并给出可直接复制的 robots.txt 模板。

AI 爬虫 robots 放行与屏蔽决策的三类框架示意图

robots.txt 还管得住今天的 AI 爬虫吗?

robots.txt 是一份「君子协定」,不是技术防火墙。 它声明「希望」哪些爬虫别抓哪些路径,守规矩的厂商会遵守,不守规矩的可以直接无视。大多数主流 AI 厂商(OpenAI、Google、Anthropic)公开承诺遵守 robots.txt 规则;但 2025 年 8 月 Cloudflare 关于 Perplexity 使用隐身爬虫绕过 robots 的调查 显示,即便站点同时在 robots.txt 和 WAF 里封了 PerplexityBot,Perplexity 仍用伪装成 macOS Chrome 用户的未声明爬虫继续抓取,涉及数万域名、每天数百万次请求。

所以正确心态是:robots.txt 决定「守规矩爬虫」的行为,对「不守规矩的」要靠 WAF/防火墙兜底。 先把君子协定写对,是性价比最高的第一步。

AI 爬虫分三类:这是整套决策的主线

理解放行决策,关键是先分清一个爬虫到底在干什么。所有 AI 爬虫可归为三类,对你的影响完全不同。

训练爬虫:抓你的内容去喂大模型

训练爬虫把网页内容收进语料库,用于训练大语言模型。屏蔽它保护的是版权和内容资产,而不会让你在 AI 搜索里掉可见度——因为 AI 搜索答案靠的是实时检索,不是训练记忆。代表:GPTBot、Google-Extended、ClaudeBot、字节 Bytespider、Common Crawl 的 CCBot。

实时检索爬虫:决定你能不能被 AI 答案引用

这是唯一「屏蔽就直接丢可见度」的一类,默认全放。 当 AI 回答需要最新信息的问题时,它实时抓取网页、把页面作为答案的引用来源。屏蔽它,等于把品牌从 ChatGPT、Perplexity、AI Overviews 的答案里手动删除。代表:OAI-SearchBot(ChatGPT 搜索)、Claude-SearchBot(Claude)、PerplexityBot(Perplexity)、Googlebot(同时喂 AI Overviews)、Bingbot(同时喂 Microsoft Copilot)。

用户触发抓取:高意图流量,别误伤

当用户主动贴一个链接、或要求 AI「读一下这个页面」时触发的抓取,属于用户行为而非自动爬取。代表:ChatGPT-User、Perplexity-User、Claude-User。这是意图最强的一拨访问,默认应放行;OpenAI 也明确说明这类由用户发起的动作 robots.txt 规则未必适用。

一句话记住分类逻辑:屏蔽训练≠丢可见度,屏蔽检索=丢可见度,屏蔽用户触发=赶走高意图用户。

逐个 AI 爬虫的放行/屏蔽建议(对照表)

下面是各家主流 AI 爬虫的 user-agent、职能与建议。user-agent 与职能依据 OpenAI 官方爬虫文档Google Search Central 的爬虫与 user-agent 总览

各家 AI 爬虫 user-agent 与放行建议对照表
User-agent 厂商/平台 职能 放行建议
GPTBot OpenAI 训练 按版权立场可屏蔽(不影响 ChatGPT 搜索)
OAI-SearchBot OpenAI ChatGPT 搜索收录(检索) 放行
ChatGPT-User OpenAI 用户触发取页 放行
Googlebot Google 搜索索引 + AI Overviews 来源 放行(屏蔽=丢自然搜索)
Google-Extended Google Gemini 训练/grounding 控制令牌(非独立爬虫) 按版权立场可屏蔽,不影响排名
Bingbot Microsoft 搜索索引 + Copilot 来源 放行(屏蔽=丢 Bing 搜索与 Copilot 引用)
ClaudeBot Anthropic 训练 按版权立场可屏蔽
Claude-SearchBot Anthropic 搜索索引(检索) 放行
Claude-User Anthropic 用户触发取页 放行
PerplexityBot Perplexity 检索/索引 放行(注意其合规争议)
Perplexity-User Perplexity 用户触发取页 放行
Bytespider 字节跳动 训练(喂豆包等) 按版权与服务器负载,可限流或屏蔽
Applebot-Extended Apple Apple Intelligence 训练控制令牌(非独立爬虫) 按版权立场可屏蔽,不影响 Applebot 搜索
Meta-ExternalAgent Meta 训练(喂 Meta AI / Llama) 按版权立场可屏蔽
Amazonbot Amazon 检索(Alexa 问答等) 放行
CCBot Common Crawl 公共训练语料 按版权立场,多为训练用途,可屏蔽

三个最常被搞错的点值得单独强调:

  • GPTBot ≠ ChatGPT 搜索。 屏蔽 GPTBot 只是不让你的内容进训练语料,ChatGPT 搜索结果走的是 OAI-SearchBot,照样能收录你。三个 OpenAI 爬虫可独立控制。
  • Google-Extended 不是爬虫,是个开关。 它只控制内容是否用于 Gemini 训练与 grounding,不影响搜索收录、排名,也挡不住 AI Overviews——后者用的是 Googlebot 主索引。想从 AI Overviews 消失,只能屏蔽 Googlebot,但那会同时毁掉你的自然搜索。
  • Bingbot 是 Copilot 的隐形地基。 Microsoft Copilot 的引用取自 Bing 索引,屏蔽 Bingbot 不只丢 Bing 自然搜索,也丢 Copilot 引用——和「Googlebot 之于 AI Overviews」同理。

中文 AI 平台特殊在哪:豆包、DeepSeek、Kimi、通义的检索来源地图

国内平台的关键差异:很多中文 AI 不靠「自己的爬虫」实时抓你,而是走搜索后端或自家内容生态。 这意味着——在 robots.txt 里封掉 Bytespider,挡得住字节的训练抓取,却挡不住豆包从头条搜索、字节生态里取到你的内容。想做 DeepSeek 品牌推荐、豆包品牌推荐,光看 robots 不够,得看它们的检索来源。

下表综合 MaxAEO 在各平台监测中观察到的引用来源结构与公开实测:

平台 联网检索特点 主要内容来源 对 robots 与布点的启示
DeepSeek 默认知识库模式,开「深度思考+联网」才实时取页 新闻媒体、知乎等 UGC、官网 放行主流检索爬虫,同时在媒体与知乎沉淀内容
豆包 字节生态优先 抖音/抖音百科/今日头条 + 媒体 + 官网 屏蔽 Bytespider≠挡住豆包检索,重点是铺字节生态
Kimi 联网最稳定,多数对话实时检索,段落级引用 以知乎等 UGC 为主 放行检索爬虫 + 在知乎等高权重 UGC 布点
通义千问 与夸克搜索逻辑相近 以新闻媒体为主 + 官网 + 垂直站 放行检索 + 媒体/官网内容结构化
文心一言 百度系为主,部分结合 DeepSeek 百家号、百度百科 + 媒体 放行 Baiduspider + 百家号布点
腾讯元宝 微信生态优先 以公众号、视频号为主 + 媒体 微信生态布点为主,robots 影响有限

结论很实际:在中文场景,「放行检索爬虫」是地基,「在对的平台生态里铺内容」才是上层建筑。 想把这套来源结构落成可执行的平台优先级、指标与 Prompt 库,可参考 国内 AI 搜索平台监控清单

可见度 vs 版权:三种立场 + 一份推荐模板

没有「标准答案」,只有「立场」。 放行决策本质是在 AI 可见度和内容版权之间取舍,按品牌类型选一档即可。

立场 适合谁 训练类爬虫 检索类爬虫 用户触发
可见度优先 新品牌、电商、SaaS 抢 AI 曝光 多数放行(仅限流抓取过猛的) 全放 全放
平衡(推荐) 大多数品牌 屏蔽 全放 全放
版权优先 媒体、原创内容站、付费内容 全屏 + WAF 兜底 按授权放行、争议爬虫屏蔽 放行

多数品牌选「平衡档」:放行所有检索与用户触发爬虫保住可见度,屏蔽纯训练爬虫保护内容。下面这份 robots.txt 可直接改用(Allow: / 对默认放行的爬虫是显式声明,便于团队读懂):

# 放行实时检索 / 搜索类 AI 爬虫(保住 AI 可见度与引用)
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /

# 放行用户触发取页(高意图流量,别误伤)
User-agent: ChatGPT-User
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Claude-User
Allow: /

# 屏蔽纯训练类爬虫(保护内容资产,不影响 AI 搜索可见度)
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /

# 搜索引擎主爬虫务必放行(同时是 AI Overviews / Copilot / 百度的来源)
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
User-agent: Baiduspider
Allow: /

调成「可见度优先」:把上面训练类的 Disallow: / 删掉、只对 Bytespider 这类抓取过猛的做限流(限流建议在服务器/CDN 做,robots 的 Crawl-delay 主流爬虫如 Googlebot 并不遵守)。调成「版权优先」:保留检索放行,对 Perplexity 这类有合规争议的也屏蔽,并叠加 WAF 拦截,同时优先走内容授权而非免费放行。

robots.txt 之外:为什么光写 Disallow 不够

robots.txt 有三个天然盲区,必须用别的手段补。

  • 伪装爬虫无视协定。 如前述 Perplexity 案例,换 UA、换 IP 就能绕过 robots.txt 和按 UA 设的 WAF 规则。对版权敏感的内容,要在 CDN/防火墙层做 bot 管理(行为指纹、速率限制、质询验证),而非只靠一行 Disallow。
  • 用户触发类未必受 robots 约束。 这类被定义为「用户行为」,规则可能不适用,这也是它通常该放行的原因。
  • 抓得到 ≠ 看得懂 ≠ 被引用。 放行了,若页面是纯前端渲染的 SPA、缺结构化数据,AI 仍读不到内容。先确保服务端渲染或预渲染、补齐结构化数据,再谈放行;想用更明确的信号引导 AI,可评估要不要做 llms.txt。

还有个易踩的坑:别再用废弃 UA。 Anthropic 的 anthropic-aiClaude-Web 已停用,现役是 ClaudeBot、Claude-SearchBot、Claude-User——只封旧名等于没封。

配置前后怎么验证:AI 爬虫 robots 诊断清单

「放行」只是开始,真正的验收标准是品牌有没有被 AI 提及和引用。 按下面顺序走一遍:

AI 爬虫 robots 配置诊断与服务器日志核验流程
  1. 查日志:在服务器/CDN 访问日志里筛 user-agent,看清楚哪些 AI 爬虫真的来过、来抓了哪些页、频率多高。
  2. 对照三类:把抓到的 UA 归到训练/检索/用户触发,判断当前是否误伤了检索类。
  3. 改 robots:按选定立场更新 robots.txt,部署后用线上 robots 测试工具确认语法生效。
  4. 验抓取:观察 OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot、Bingbot 是否恢复正常抓取。
  5. 测可见度:在 DeepSeek、豆包、Kimi、通义里用真实 Prompt 提问,看品牌是否被提及、引用来源是否指向你;具体测法可对照 怎么查品牌有没有被 AI 推荐的自测清单

第 5 步靠人工抽查难以持续,且 同一问题在不同平台、不同时间结果会变,单次截图不可信。这正是 AI 品牌监测要解决的事:用固定 Prompt 库定期跑各平台,追踪 AI 提及率、AI 排名、引用来源和竞品表现的变化——这是 MaxAEO 在 DeepSeek、豆包、Kimi、通义千问等平台上做的核心工作。想把监测落成可复用的指标与看板,可参考 AI 品牌监测怎么做:Prompt、指标、看板与工具选型。配置 robots 是「让 AI 进得来」,持续监测才知道「进来后有没有引用你、有没有被竞品盖过」。

常见问题

屏蔽 GPTBot 会影响我在 ChatGPT 搜索里的展示吗?
不会。GPTBot 只负责训练数据收集,ChatGPT 搜索结果由 OAI-SearchBot 抓取。两者可独立控制,放行 OAI-SearchBot、屏蔽 GPTBot 是常见组合。

屏蔽 Google-Extended 会让我搜索排名下降吗?
不会。Google-Extended 只控制内容是否用于 Gemini 训练与 grounding,不影响 Google 搜索的收录与排名,也挡不住 AI Overviews(它用 Googlebot 主索引)。

写了 robots.txt 屏蔽,爬虫就一定不抓了吗?
不一定。robots.txt 依赖厂商自觉遵守。已有调查显示个别厂商用未声明的隐身爬虫绕过规则,对版权敏感内容需在 WAF/防火墙层叠加拦截。

只想进豆包、通义,robots 该怎么配?
先放行检索与用户触发类爬虫做地基。但国内平台更多走搜索后端和自家生态:豆包看字节生态(头条搜索)、通义看新闻媒体与夸克、Kimi 看知乎 UGC,布点比 robots 更关键。

全屏所有 AI 爬虫,是不是最安全?
对版权最安全,对增长最危险。全屏检索类 = 主动放弃 AI 可见度,让竞品独占 AI 答案里的推荐位。建议至少保留检索与用户触发类的放行。