AI 爬虫 robots 配置的核心结论先给你:别一刀切「全放」或「全封」。该把 AI 爬虫按职能分成训练、实时检索、用户触发三类,分别决策——屏蔽训练类几乎不影响你在 AI 搜索里的可见度;但屏蔽实时检索类,等于亲手把品牌从 DeepSeek、豆包、ChatGPT、Perplexity 的答案里删掉。下面逐个爬虫拆开讲,并给出可直接复制的 robots.txt 模板。

robots.txt 还管得住今天的 AI 爬虫吗?
robots.txt 是一份「君子协定」,不是技术防火墙。 它声明「希望」哪些爬虫别抓哪些路径,守规矩的厂商会遵守,不守规矩的可以直接无视。大多数主流 AI 厂商(OpenAI、Google、Anthropic)公开承诺遵守 robots.txt 规则;但 2025 年 8 月 Cloudflare 关于 Perplexity 使用隐身爬虫绕过 robots 的调查 显示,即便站点同时在 robots.txt 和 WAF 里封了 PerplexityBot,Perplexity 仍用伪装成 macOS Chrome 用户的未声明爬虫继续抓取,涉及数万域名、每天数百万次请求。
所以正确心态是:robots.txt 决定「守规矩爬虫」的行为,对「不守规矩的」要靠 WAF/防火墙兜底。 先把君子协定写对,是性价比最高的第一步。
AI 爬虫分三类:这是整套决策的主线
理解放行决策,关键是先分清一个爬虫到底在干什么。所有 AI 爬虫可归为三类,对你的影响完全不同。
训练爬虫:抓你的内容去喂大模型
训练爬虫把网页内容收进语料库,用于训练大语言模型。屏蔽它保护的是版权和内容资产,而不会让你在 AI 搜索里掉可见度——因为 AI 搜索答案靠的是实时检索,不是训练记忆。代表:GPTBot、Google-Extended、ClaudeBot、字节 Bytespider、Common Crawl 的 CCBot。
实时检索爬虫:决定你能不能被 AI 答案引用
这是唯一「屏蔽就直接丢可见度」的一类,默认全放。 当 AI 回答需要最新信息的问题时,它实时抓取网页、把页面作为答案的引用来源。屏蔽它,等于把品牌从 ChatGPT、Perplexity、AI Overviews 的答案里手动删除。代表:OAI-SearchBot(ChatGPT 搜索)、Claude-SearchBot(Claude)、PerplexityBot(Perplexity)、Googlebot(同时喂 AI Overviews)、Bingbot(同时喂 Microsoft Copilot)。
用户触发抓取:高意图流量,别误伤
当用户主动贴一个链接、或要求 AI「读一下这个页面」时触发的抓取,属于用户行为而非自动爬取。代表:ChatGPT-User、Perplexity-User、Claude-User。这是意图最强的一拨访问,默认应放行;OpenAI 也明确说明这类由用户发起的动作 robots.txt 规则未必适用。
一句话记住分类逻辑:屏蔽训练≠丢可见度,屏蔽检索=丢可见度,屏蔽用户触发=赶走高意图用户。
逐个 AI 爬虫的放行/屏蔽建议(对照表)
下面是各家主流 AI 爬虫的 user-agent、职能与建议。user-agent 与职能依据 OpenAI 官方爬虫文档 与 Google Search Central 的爬虫与 user-agent 总览。

| User-agent | 厂商/平台 | 职能 | 放行建议 |
|---|---|---|---|
| GPTBot | OpenAI | 训练 | 按版权立场可屏蔽(不影响 ChatGPT 搜索) |
| OAI-SearchBot | OpenAI | ChatGPT 搜索收录(检索) | 放行 |
| ChatGPT-User | OpenAI | 用户触发取页 | 放行 |
| Googlebot | 搜索索引 + AI Overviews 来源 | 放行(屏蔽=丢自然搜索) | |
| Google-Extended | Gemini 训练/grounding 控制令牌(非独立爬虫) | 按版权立场可屏蔽,不影响排名 | |
| Bingbot | Microsoft | 搜索索引 + Copilot 来源 | 放行(屏蔽=丢 Bing 搜索与 Copilot 引用) |
| ClaudeBot | Anthropic | 训练 | 按版权立场可屏蔽 |
| Claude-SearchBot | Anthropic | 搜索索引(检索) | 放行 |
| Claude-User | Anthropic | 用户触发取页 | 放行 |
| PerplexityBot | Perplexity | 检索/索引 | 放行(注意其合规争议) |
| Perplexity-User | Perplexity | 用户触发取页 | 放行 |
| Bytespider | 字节跳动 | 训练(喂豆包等) | 按版权与服务器负载,可限流或屏蔽 |
| Applebot-Extended | Apple | Apple Intelligence 训练控制令牌(非独立爬虫) | 按版权立场可屏蔽,不影响 Applebot 搜索 |
| Meta-ExternalAgent | Meta | 训练(喂 Meta AI / Llama) | 按版权立场可屏蔽 |
| Amazonbot | Amazon | 检索(Alexa 问答等) | 放行 |
| CCBot | Common Crawl | 公共训练语料 | 按版权立场,多为训练用途,可屏蔽 |
三个最常被搞错的点值得单独强调:
- GPTBot ≠ ChatGPT 搜索。 屏蔽 GPTBot 只是不让你的内容进训练语料,ChatGPT 搜索结果走的是 OAI-SearchBot,照样能收录你。三个 OpenAI 爬虫可独立控制。
- Google-Extended 不是爬虫,是个开关。 它只控制内容是否用于 Gemini 训练与 grounding,不影响搜索收录、排名,也挡不住 AI Overviews——后者用的是 Googlebot 主索引。想从 AI Overviews 消失,只能屏蔽 Googlebot,但那会同时毁掉你的自然搜索。
- Bingbot 是 Copilot 的隐形地基。 Microsoft Copilot 的引用取自 Bing 索引,屏蔽 Bingbot 不只丢 Bing 自然搜索,也丢 Copilot 引用——和「Googlebot 之于 AI Overviews」同理。
中文 AI 平台特殊在哪:豆包、DeepSeek、Kimi、通义的检索来源地图
国内平台的关键差异:很多中文 AI 不靠「自己的爬虫」实时抓你,而是走搜索后端或自家内容生态。 这意味着——在 robots.txt 里封掉 Bytespider,挡得住字节的训练抓取,却挡不住豆包从头条搜索、字节生态里取到你的内容。想做 DeepSeek 品牌推荐、豆包品牌推荐,光看 robots 不够,得看它们的检索来源。
下表综合 MaxAEO 在各平台监测中观察到的引用来源结构与公开实测:
| 平台 | 联网检索特点 | 主要内容来源 | 对 robots 与布点的启示 |
|---|---|---|---|
| DeepSeek | 默认知识库模式,开「深度思考+联网」才实时取页 | 新闻媒体、知乎等 UGC、官网 | 放行主流检索爬虫,同时在媒体与知乎沉淀内容 |
| 豆包 | 字节生态优先 | 抖音/抖音百科/今日头条 + 媒体 + 官网 | 屏蔽 Bytespider≠挡住豆包检索,重点是铺字节生态 |
| Kimi | 联网最稳定,多数对话实时检索,段落级引用 | 以知乎等 UGC 为主 | 放行检索爬虫 + 在知乎等高权重 UGC 布点 |
| 通义千问 | 与夸克搜索逻辑相近 | 以新闻媒体为主 + 官网 + 垂直站 | 放行检索 + 媒体/官网内容结构化 |
| 文心一言 | 百度系为主,部分结合 DeepSeek | 百家号、百度百科 + 媒体 | 放行 Baiduspider + 百家号布点 |
| 腾讯元宝 | 微信生态优先 | 以公众号、视频号为主 + 媒体 | 微信生态布点为主,robots 影响有限 |
结论很实际:在中文场景,「放行检索爬虫」是地基,「在对的平台生态里铺内容」才是上层建筑。 想把这套来源结构落成可执行的平台优先级、指标与 Prompt 库,可参考 国内 AI 搜索平台监控清单。
可见度 vs 版权:三种立场 + 一份推荐模板
没有「标准答案」,只有「立场」。 放行决策本质是在 AI 可见度和内容版权之间取舍,按品牌类型选一档即可。
| 立场 | 适合谁 | 训练类爬虫 | 检索类爬虫 | 用户触发 |
|---|---|---|---|---|
| 可见度优先 | 新品牌、电商、SaaS 抢 AI 曝光 | 多数放行(仅限流抓取过猛的) | 全放 | 全放 |
| 平衡(推荐) | 大多数品牌 | 屏蔽 | 全放 | 全放 |
| 版权优先 | 媒体、原创内容站、付费内容 | 全屏 + WAF 兜底 | 按授权放行、争议爬虫屏蔽 | 放行 |
多数品牌选「平衡档」:放行所有检索与用户触发爬虫保住可见度,屏蔽纯训练爬虫保护内容。下面这份 robots.txt 可直接改用(Allow: / 对默认放行的爬虫是显式声明,便于团队读懂):
# 放行实时检索 / 搜索类 AI 爬虫(保住 AI 可见度与引用)
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# 放行用户触发取页(高意图流量,别误伤)
User-agent: ChatGPT-User
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Claude-User
Allow: /
# 屏蔽纯训练类爬虫(保护内容资产,不影响 AI 搜索可见度)
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
# 搜索引擎主爬虫务必放行(同时是 AI Overviews / Copilot / 百度的来源)
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
User-agent: Baiduspider
Allow: /
调成「可见度优先」:把上面训练类的 Disallow: / 删掉、只对 Bytespider 这类抓取过猛的做限流(限流建议在服务器/CDN 做,robots 的 Crawl-delay 主流爬虫如 Googlebot 并不遵守)。调成「版权优先」:保留检索放行,对 Perplexity 这类有合规争议的也屏蔽,并叠加 WAF 拦截,同时优先走内容授权而非免费放行。
robots.txt 之外:为什么光写 Disallow 不够
robots.txt 有三个天然盲区,必须用别的手段补。
- 伪装爬虫无视协定。 如前述 Perplexity 案例,换 UA、换 IP 就能绕过 robots.txt 和按 UA 设的 WAF 规则。对版权敏感的内容,要在 CDN/防火墙层做 bot 管理(行为指纹、速率限制、质询验证),而非只靠一行 Disallow。
- 用户触发类未必受 robots 约束。 这类被定义为「用户行为」,规则可能不适用,这也是它通常该放行的原因。
- 抓得到 ≠ 看得懂 ≠ 被引用。 放行了,若页面是纯前端渲染的 SPA、缺结构化数据,AI 仍读不到内容。先确保服务端渲染或预渲染、补齐结构化数据,再谈放行;想用更明确的信号引导 AI,可评估要不要做 llms.txt。
还有个易踩的坑:别再用废弃 UA。 Anthropic 的 anthropic-ai 与 Claude-Web 已停用,现役是 ClaudeBot、Claude-SearchBot、Claude-User——只封旧名等于没封。
配置前后怎么验证:AI 爬虫 robots 诊断清单
「放行」只是开始,真正的验收标准是品牌有没有被 AI 提及和引用。 按下面顺序走一遍:

- 查日志:在服务器/CDN 访问日志里筛 user-agent,看清楚哪些 AI 爬虫真的来过、来抓了哪些页、频率多高。
- 对照三类:把抓到的 UA 归到训练/检索/用户触发,判断当前是否误伤了检索类。
- 改 robots:按选定立场更新 robots.txt,部署后用线上 robots 测试工具确认语法生效。
- 验抓取:观察 OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot、Bingbot 是否恢复正常抓取。
- 测可见度:在 DeepSeek、豆包、Kimi、通义里用真实 Prompt 提问,看品牌是否被提及、引用来源是否指向你;具体测法可对照 怎么查品牌有没有被 AI 推荐的自测清单。
第 5 步靠人工抽查难以持续,且 同一问题在不同平台、不同时间结果会变,单次截图不可信。这正是 AI 品牌监测要解决的事:用固定 Prompt 库定期跑各平台,追踪 AI 提及率、AI 排名、引用来源和竞品表现的变化——这是 MaxAEO 在 DeepSeek、豆包、Kimi、通义千问等平台上做的核心工作。想把监测落成可复用的指标与看板,可参考 AI 品牌监测怎么做:Prompt、指标、看板与工具选型。配置 robots 是「让 AI 进得来」,持续监测才知道「进来后有没有引用你、有没有被竞品盖过」。
常见问题
屏蔽 GPTBot 会影响我在 ChatGPT 搜索里的展示吗?
不会。GPTBot 只负责训练数据收集,ChatGPT 搜索结果由 OAI-SearchBot 抓取。两者可独立控制,放行 OAI-SearchBot、屏蔽 GPTBot 是常见组合。
屏蔽 Google-Extended 会让我搜索排名下降吗?
不会。Google-Extended 只控制内容是否用于 Gemini 训练与 grounding,不影响 Google 搜索的收录与排名,也挡不住 AI Overviews(它用 Googlebot 主索引)。
写了 robots.txt 屏蔽,爬虫就一定不抓了吗?
不一定。robots.txt 依赖厂商自觉遵守。已有调查显示个别厂商用未声明的隐身爬虫绕过规则,对版权敏感内容需在 WAF/防火墙层叠加拦截。
只想进豆包、通义,robots 该怎么配?
先放行检索与用户触发类爬虫做地基。但国内平台更多走搜索后端和自家生态:豆包看字节生态(头条搜索)、通义看新闻媒体与夸克、Kimi 看知乎 UGC,布点比 robots 更关键。
全屏所有 AI 爬虫,是不是最安全?
对版权最安全,对增长最危险。全屏检索类 = 主动放弃 AI 可见度,让竞品独占 AI 答案里的推荐位。建议至少保留检索与用户触发类的放行。