作者:maxaeo.cn|发布日期:2026-09-01|更新日期:2026-09-01
大模型爬虫请求头指 AI 搜索、答案引擎或训练爬虫访问网页时发送的 HTTP 头部信息,其中最常被用来识别身份的是 User-Agent。但在真实排查中,只看 UA 很容易误判,必须结合 IP、CDN 转发头、状态码、robots.txt 与后续 AI 引用结果一起判断。

什么是大模型爬虫请求头?
大模型爬虫请求头是 AI 相关机器人向网站发起请求时携带的一组 HTTP 字段,用来说明客户端身份、可接受内容类型、压缩方式、来源链路和代理转发信息。
最关键字段是 User-Agent,例如 GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot、Bytespider 等。Cloudflare 的 AI 爬虫机器人参考表也按运营方、用途和 User-Agent 对常见 AI Bot 做了分类。
但 UA 本质是“自报家门”,任何请求都可以伪造。生产环境不能把“UA 里包含某个 Bot 名称”直接等同于“官方爬虫已访问”。
只看 User-Agent 为什么不够?
只看 User-Agent 不够,因为它无法证明请求来源真实,也无法说明页面是否被成功抓取、是否被 AI 引用、是否被 WAF 或 CDN 中途拦截。
更稳妥的判断应分成三层:
| 层级 | 要看的证据 | 能回答的问题 |
|---|---|---|
| 身份层 | User-Agent、IP、反向 DNS、ASN、官方 IP 段 |
它是不是自称的 AI 爬虫 |
| 访问层 | URL、状态码、响应大小、耗时、缓存命中、WAF 动作 | 它有没有拿到有效页面 |
| 结果层 | AI 回答是否提及、是否引用该 URL、情绪是否准确 | 抓取是否转化为可见性 |
例如,Perplexity 官方文档区分 PerplexityBot 与 Perplexity-User,并说明后者与用户请求触发有关;Anthropic 也在 Claude 爬虫说明中区分训练、搜索和用户触发访问。不同类型的 Bot,处理策略不应相同。
日志里应该保留哪些请求头字段?
排查 AI 爬虫抓取时,日志至少要保留 UA、真实客户端 IP、转发链路、访问 URL、状态码、响应大小、WAF 结果和 robots.txt 访问记录。
建议 Nginx、CDN 或日志平台至少记录这些字段:
| 字段 | 示例 | 排查价值 |
|---|---|---|
time |
2026-09-01T10:21:33+08:00 |
判断抓取频率与波峰 |
remote_addr |
203.0.113.10 |
初始来源 IP,但可能是 CDN 节点 |
http_user_agent |
Bytespider |
初步识别 AI 爬虫 UA |
http_x_forwarded_for |
多个 IP | 还原代理链路 |
cf_connecting_ip / 类似字段 |
真实访客 IP | CDN 后站点必看 |
request_uri |
/pricing/ |
判断抓取页面类型 |
status |
200 / 403 / 429 / 503 |
判断是否被放行或限流 |
body_bytes_sent |
48213 |
判断是否返回了完整内容 |
request_time |
1.283 |
判断是否超时 |
waf_action |
allow / block / challenge |
判断安全策略是否误拦 |
如果站点使用 Cloudflare,可继续阅读 Cloudflare 机器人白名单配置:搜索爬虫与 AI 爬虫放行指南,重点排查 WAF、Bot Fight Mode、速率限制和缓存规则是否覆盖到 AI Bot。
常见 AI 爬虫 UA 应该怎么分类?
AI 爬虫 UA 应按“训练抓取、搜索抓取、用户触发取回、传统搜索爬虫”分类,而不是简单地全部放行或全部屏蔽。
| 类型 | 常见标识 | 建议策略 |
|---|---|---|
| 训练抓取 | GPTBot、ClaudeBot、ChatGLM-Spider |
按内容授权态度决定 |
| AI 搜索抓取 | OAI-SearchBot、Claude-SearchBot、PerplexityBot |
若希望被答案引用,通常应放行核心公开页 |
| 用户触发取回 | ChatGPT-User、Claude-User、Perplexity-User、Kimi-User |
多数场景建议放行,避免真实用户访问受阻 |
| 搜索基础设施 | Googlebot、Bingbot、Baiduspider |
影响传统搜索收录,需单独管理 |
| 国产 AI 或平台型 Bot | Bytespider、KimiBot 等 |
结合频率、页面类型和业务目标限速放行 |
Google 官方说明中,Google-Extended 是用于控制内容是否可被部分 Gemini 相关用途使用的 robots.txt 产品令牌;它不是普通日志里必然出现的爬虫 UA,可参考 Google 常用抓取工具文档。
国产 AI 场景更复杂。DeepSeek 相关抓取经常被站长关注,但稳定、公开、可验证的官方 UA 与 IP 段并不总是充分。针对这类问题,可结合 DeepSeekBot User-agent 怎么写和 deepseek 爬虫验证方法做交叉判断。

如何验证一个请求真的是 AI 爬虫?
验证 AI 爬虫不要停在字符串匹配,应采用“UA 命中—来源校验—访问结果—AI 结果复测”的四步法。
-
先匹配 UA token
从日志中筛选包含Bot、Spider、Crawler、SearchBot、User等标识的请求,再按厂商归类。 -
再核验来源网络
对有官方 IP 段或验证方式的爬虫,使用官方文档、反向 DNS 或 ASN 校验。没有公开验证方式时,只能标记为“疑似”,不要作为确定结论。 -
检查访问是否成功
重点看status=200、响应大小是否接近正常页面、是否返回登录页、验证码页、空白页或 403。 -
复测 AI 回答是否变化
如果目标是 AI 搜索可见性,不应只看抓取日志。还要在同一批问题、同一批平台中复测品牌是否被提及、排序是否提升、引用 URL 是否出现。
MaxAEO 在 AI 搜索可见性诊断中也采用类似思路:先锁定品牌在多个 AI 平台中的提及率、排序、情绪与引用来源,再判断问题出在“未被抓取”“抓取了但信源弱”,还是“信源存在但描述不准”。
WAF 与 CDN 放行要注意什么?
AI 爬虫放行应遵循最小权限原则:只放行需要被索引和引用的公开内容目录,不要为了 Bot 打开后台、接口、搜索结果页和参数页。
推荐顺序是:
-
robots.txt 先表达意图
明确哪些目录允许抓取,哪些目录不希望进入训练或索引。 -
CDN/WAF 再做执行层规则
对可信 UA 加条件放行,但最好叠加 IP、路径、频率、国家地区、请求方法等限制。 -
对高频 Bot 使用限速而非一刀切封禁
例如对内容页允许 GET,对接口和后台直接拦截;对异常频率返回 429,并配合Retry-After。 -
上线后做同口径复测
修改规则后至少观察 3–7 天,看 403、429、5xx 是否下降,核心页面 200 请求是否增加。
如果 DeepSeek、豆包、Kimi 等国产 AI 的访问被安全规则误伤,可参考 AI 爬虫访问被拦截:从 robots.txt 到 WAF 的排查与最小放行进一步定位。
一个实用的“抓取诊断打分表”
判断 AI 抓取是否健康,可以用 100 分模型:身份可信度 30 分、访问成功率 30 分、内容可读性 20 分、AI 引用转化 20 分。
| 维度 | 满分 | 判定方法 |
|---|---|---|
| 身份可信度 | 30 | UA 与官方标识匹配,且来源 IP/ASN 可解释 |
| 访问成功率 | 30 | 核心 URL 返回 200,非验证码页,响应体完整 |
| 内容可读性 | 20 | HTML 主体清晰,标题、正文、结构化信息可解析 |
| 引用转化 | 20 | AI 回答中出现品牌、页面或引用来源 |
这个表的价值在于把“有没有爬”与“有没有被推荐”分开。很多站点日志里有 AI Bot 访问,但 AI 回答仍不提品牌,原因往往不是 WAF,而是页面缺少可引用的实体信息、对比信息、场景问题和第三方信源。
MaxAEO 国内版 maxaeo.cn 覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,可监测品牌提及率、排序、情绪评价与引用来源,并支持通过引用溯源判断哪些页面真正进入 AI 回答链路。
从请求头到 AI 可见性的排查闭环
大模型爬虫请求头排查的终点不是“识别 Bot”,而是确认公开内容能否被 AI 正确理解、引用和推荐。
一个完整闭环可以这样做:
- 锁基线:记录当前 10–20 个核心问题下,品牌在 AI 平台中的提及、排序和引用来源。
- 查日志:筛选 AI UA、状态码、被抓 URL、WAF 动作和响应大小。
- 补信源:修复被拦页面,补足产品页、对比页、FAQ、案例页和结构化内容片段。
- 看回声:每天用同一组问题复测,观察提及率、推荐位次和引用 URL 变化。
如果站点已经有传统 SEO 流量,却在 AI 回答中缺席,建议使用 MaxAEO 的免费 AI 可见性诊断:输入官网域名即可生成包含提及率与核心结论的报告,并进一步查看品牌在国产 AI 中的表现缺口。

常见问题
大模型爬虫请求头里最重要的字段是什么?
最重要的是 User-Agent,但它只能做初筛。真实排查还要看来源 IP、CDN 转发头、状态码、响应大小、WAF 动作和目标 URL,否则容易把伪装请求当成官方 Bot。
看到 DeepSeekBot 就说明 DeepSeek 抓取官网吗?
不能直接这么判断。UA 可以伪造,而且不同 AI 平台可能通过搜索引擎、合作信源或第三方接口获取内容。更可靠的方法是同时检查日志访问、搜索收录、AI 回答引用和复测结果。
应该放行所有 AI 爬虫吗?
不建议。训练类、搜索类、用户触发类 Bot 的业务影响不同。希望被 AI 搜索引用的公开内容页可以放行;后台、接口、隐私页、搜索结果页和高成本参数页应继续限制。
robots.txt 能控制所有 AI 爬虫吗?
不能。robots.txt 是协议声明,不是强制访问控制。合规爬虫通常会参考它,但恶意或伪装请求可能忽略规则。真正的拦截和限速还需要 WAF、CDN、服务器规则配合。
如何判断放行后有没有效果?
看四个指标:核心页面 AI Bot 的 200 请求是否增加,403/429 是否下降,AI 回答是否开始提及品牌,引用来源中是否出现自有域名或目标页面。只看日志访问量不足以判断 GEO/AEO 效果。
