大模型爬虫请求头识别:日志字段、UA 验证与放行排查

大模型爬虫请求头识别:日志字段、UA 验证与放行排查

作者:maxaeo.cn|发布日期:2026-09-01|更新日期:2026-09-01

大模型爬虫请求头指 AI 搜索、答案引擎或训练爬虫访问网页时发送的 HTTP 头部信息,其中最常被用来识别身份的是 User-Agent。但在真实排查中,只看 UA 很容易误判,必须结合 IP、CDN 转发头、状态码、robots.txt 与后续 AI 引用结果一起判断。

大模型爬虫请求头在服务器日志中的识别字段示意图

什么是大模型爬虫请求头?

大模型爬虫请求头是 AI 相关机器人向网站发起请求时携带的一组 HTTP 字段,用来说明客户端身份、可接受内容类型、压缩方式、来源链路和代理转发信息。

最关键字段是 User-Agent,例如 GPTBotOAI-SearchBotClaudeBotPerplexityBotBytespider 等。Cloudflare 的 AI 爬虫机器人参考表也按运营方、用途和 User-Agent 对常见 AI Bot 做了分类。

但 UA 本质是“自报家门”,任何请求都可以伪造。生产环境不能把“UA 里包含某个 Bot 名称”直接等同于“官方爬虫已访问”。

只看 User-Agent 为什么不够?

只看 User-Agent 不够,因为它无法证明请求来源真实,也无法说明页面是否被成功抓取、是否被 AI 引用、是否被 WAF 或 CDN 中途拦截。

更稳妥的判断应分成三层:

层级 要看的证据 能回答的问题
身份层 User-Agent、IP、反向 DNS、ASN、官方 IP 段 它是不是自称的 AI 爬虫
访问层 URL、状态码、响应大小、耗时、缓存命中、WAF 动作 它有没有拿到有效页面
结果层 AI 回答是否提及、是否引用该 URL、情绪是否准确 抓取是否转化为可见性

例如,Perplexity 官方文档区分 PerplexityBotPerplexity-User,并说明后者与用户请求触发有关;Anthropic 也在 Claude 爬虫说明中区分训练、搜索和用户触发访问。不同类型的 Bot,处理策略不应相同。

日志里应该保留哪些请求头字段?

排查 AI 爬虫抓取时,日志至少要保留 UA、真实客户端 IP、转发链路、访问 URL、状态码、响应大小、WAF 结果和 robots.txt 访问记录。

建议 Nginx、CDN 或日志平台至少记录这些字段:

字段 示例 排查价值
time 2026-09-01T10:21:33+08:00 判断抓取频率与波峰
remote_addr 203.0.113.10 初始来源 IP,但可能是 CDN 节点
http_user_agent Bytespider 初步识别 AI 爬虫 UA
http_x_forwarded_for 多个 IP 还原代理链路
cf_connecting_ip / 类似字段 真实访客 IP CDN 后站点必看
request_uri /pricing/ 判断抓取页面类型
status 200 / 403 / 429 / 503 判断是否被放行或限流
body_bytes_sent 48213 判断是否返回了完整内容
request_time 1.283 判断是否超时
waf_action allow / block / challenge 判断安全策略是否误拦

如果站点使用 Cloudflare,可继续阅读 Cloudflare 机器人白名单配置:搜索爬虫与 AI 爬虫放行指南,重点排查 WAF、Bot Fight Mode、速率限制和缓存规则是否覆盖到 AI Bot。

常见 AI 爬虫 UA 应该怎么分类?

AI 爬虫 UA 应按“训练抓取、搜索抓取、用户触发取回、传统搜索爬虫”分类,而不是简单地全部放行或全部屏蔽。

类型 常见标识 建议策略
训练抓取 GPTBotClaudeBotChatGLM-Spider 按内容授权态度决定
AI 搜索抓取 OAI-SearchBotClaude-SearchBotPerplexityBot 若希望被答案引用,通常应放行核心公开页
用户触发取回 ChatGPT-UserClaude-UserPerplexity-UserKimi-User 多数场景建议放行,避免真实用户访问受阻
搜索基础设施 GooglebotBingbotBaiduspider 影响传统搜索收录,需单独管理
国产 AI 或平台型 Bot BytespiderKimiBot 结合频率、页面类型和业务目标限速放行

Google 官方说明中,Google-Extended 是用于控制内容是否可被部分 Gemini 相关用途使用的 robots.txt 产品令牌;它不是普通日志里必然出现的爬虫 UA,可参考 Google 常用抓取工具文档

国产 AI 场景更复杂。DeepSeek 相关抓取经常被站长关注,但稳定、公开、可验证的官方 UA 与 IP 段并不总是充分。针对这类问题,可结合 DeepSeekBot User-agent 怎么写deepseek 爬虫验证方法做交叉判断。

AI 爬虫 User-Agent、IP 与 WAF 放行链路排查图

如何验证一个请求真的是 AI 爬虫?

验证 AI 爬虫不要停在字符串匹配,应采用“UA 命中—来源校验—访问结果—AI 结果复测”的四步法。

  1. 先匹配 UA token
    从日志中筛选包含 BotSpiderCrawlerSearchBotUser 等标识的请求,再按厂商归类。

  2. 再核验来源网络
    对有官方 IP 段或验证方式的爬虫,使用官方文档、反向 DNS 或 ASN 校验。没有公开验证方式时,只能标记为“疑似”,不要作为确定结论。

  3. 检查访问是否成功
    重点看 status=200、响应大小是否接近正常页面、是否返回登录页、验证码页、空白页或 403。

  4. 复测 AI 回答是否变化
    如果目标是 AI 搜索可见性,不应只看抓取日志。还要在同一批问题、同一批平台中复测品牌是否被提及、排序是否提升、引用 URL 是否出现。

MaxAEO 在 AI 搜索可见性诊断中也采用类似思路:先锁定品牌在多个 AI 平台中的提及率、排序、情绪与引用来源,再判断问题出在“未被抓取”“抓取了但信源弱”,还是“信源存在但描述不准”。

WAF 与 CDN 放行要注意什么?

AI 爬虫放行应遵循最小权限原则:只放行需要被索引和引用的公开内容目录,不要为了 Bot 打开后台、接口、搜索结果页和参数页。

推荐顺序是:

  1. robots.txt 先表达意图
    明确哪些目录允许抓取,哪些目录不希望进入训练或索引。

  2. CDN/WAF 再做执行层规则
    对可信 UA 加条件放行,但最好叠加 IP、路径、频率、国家地区、请求方法等限制。

  3. 对高频 Bot 使用限速而非一刀切封禁
    例如对内容页允许 GET,对接口和后台直接拦截;对异常频率返回 429,并配合 Retry-After

  4. 上线后做同口径复测
    修改规则后至少观察 3–7 天,看 403、429、5xx 是否下降,核心页面 200 请求是否增加。

如果 DeepSeek、豆包、Kimi 等国产 AI 的访问被安全规则误伤,可参考 AI 爬虫访问被拦截:从 robots.txt 到 WAF 的排查与最小放行进一步定位。

一个实用的“抓取诊断打分表”

判断 AI 抓取是否健康,可以用 100 分模型:身份可信度 30 分、访问成功率 30 分、内容可读性 20 分、AI 引用转化 20 分。

维度 满分 判定方法
身份可信度 30 UA 与官方标识匹配,且来源 IP/ASN 可解释
访问成功率 30 核心 URL 返回 200,非验证码页,响应体完整
内容可读性 20 HTML 主体清晰,标题、正文、结构化信息可解析
引用转化 20 AI 回答中出现品牌、页面或引用来源

这个表的价值在于把“有没有爬”与“有没有被推荐”分开。很多站点日志里有 AI Bot 访问,但 AI 回答仍不提品牌,原因往往不是 WAF,而是页面缺少可引用的实体信息、对比信息、场景问题和第三方信源。

MaxAEO 国内版 maxaeo.cn 覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,可监测品牌提及率、排序、情绪评价与引用来源,并支持通过引用溯源判断哪些页面真正进入 AI 回答链路。

从请求头到 AI 可见性的排查闭环

大模型爬虫请求头排查的终点不是“识别 Bot”,而是确认公开内容能否被 AI 正确理解、引用和推荐。

一个完整闭环可以这样做:

  1. 锁基线:记录当前 10–20 个核心问题下,品牌在 AI 平台中的提及、排序和引用来源。
  2. 查日志:筛选 AI UA、状态码、被抓 URL、WAF 动作和响应大小。
  3. 补信源:修复被拦页面,补足产品页、对比页、FAQ、案例页和结构化内容片段。
  4. 看回声:每天用同一组问题复测,观察提及率、推荐位次和引用 URL 变化。

如果站点已经有传统 SEO 流量,却在 AI 回答中缺席,建议使用 MaxAEO 的免费 AI 可见性诊断:输入官网域名即可生成包含提及率与核心结论的报告,并进一步查看品牌在国产 AI 中的表现缺口。

大模型爬虫请求头排查到 AI 引用溯源的闭环流程

常见问题

大模型爬虫请求头里最重要的字段是什么?

最重要的是 User-Agent,但它只能做初筛。真实排查还要看来源 IP、CDN 转发头、状态码、响应大小、WAF 动作和目标 URL,否则容易把伪装请求当成官方 Bot。

看到 DeepSeekBot 就说明 DeepSeek 抓取官网吗?

不能直接这么判断。UA 可以伪造,而且不同 AI 平台可能通过搜索引擎、合作信源或第三方接口获取内容。更可靠的方法是同时检查日志访问、搜索收录、AI 回答引用和复测结果。

应该放行所有 AI 爬虫吗?

不建议。训练类、搜索类、用户触发类 Bot 的业务影响不同。希望被 AI 搜索引用的公开内容页可以放行;后台、接口、隐私页、搜索结果页和高成本参数页应继续限制。

robots.txt 能控制所有 AI 爬虫吗?

不能。robots.txt 是协议声明,不是强制访问控制。合规爬虫通常会参考它,但恶意或伪装请求可能忽略规则。真正的拦截和限速还需要 WAF、CDN、服务器规则配合。

如何判断放行后有没有效果?

看四个指标:核心页面 AI Bot 的 200 请求是否增加,403/429 是否下降,AI 回答是否开始提及品牌,引用来源中是否出现自有域名或目标页面。只看日志访问量不足以判断 GEO/AEO 效果。