国内大模型爬虫 user agent:识别、核验与放行清单

国内大模型爬虫 user agent:识别、核验与放行清单

作者:maxaeo.cn|发布日期:2026-08-29|更新日期:2026-08-29

国内大模型爬虫 user agent 是 AI 平台访问网页时写在 HTTP 请求头里的身份标识。它能帮助站长判断流量可能来自豆包、Kimi、DeepSeek、元宝、通义千问等平台,但不能单独作为放行依据,因为 UA 可以被伪造。

国内大模型爬虫 user agent 核验流程图

什么是国内大模型爬虫 user agent?

国内大模型爬虫 user agent 指国产 AI 平台、搜索型 AI 或其关联索引系统在抓取网页时携带的 User-Agent 字符串,用于声明访问来源、客户端类型或抓取用途。

根据 MDN 对 User-Agent 标头的说明,UA 本质上是请求方自报身份的字符串。对网站来说,它适合做“初筛”,不适合做“最终认证”。

这也是很多企业官网配置失败的根源:看到 Bytespider 就全站放行,看到陌生 UA 就全站拦截。前者可能扩大安全面,后者可能让 AI 搜索无法读取品牌页、文档页和 FAQ 页。

更稳妥的做法是:UA 识别 + IP/ASN 观察 + robots 规则 + WAF 日志 + AI 引用验证一起判断。

国内常见大模型与 AI 相关 UA 分级清单

目前国内 AI 平台并不都公开稳定爬虫标识。生产环境更适合按“可信度分级”使用,而不是把网上流传的字符串全部写进白名单。

平台或场景 可观察 UA / token 可信度 建议动作
字节系、豆包相关抓取 Bytespider 较高 可针对公开内容目录放行,并设置频率上限
百度搜索与文心相关可见性 Baiduspider 确保不被 WAF 误拦;AI 专用 UA 另行观察
Kimi 实时访问线索 Kimi-User 先进入观察名单,结合路径和频率验证
Kimi / Moonshot 相关线索 KimibotMoonshotBot 不建议仅凭字符串永久放行
智谱相关线索 ChatGLM-Spider 可记录日志,按低风险目录测试
DeepSeek 暂未见稳定公开统一 UA 不写死专属规则,优先保证公共页面可访问
通义千问 暂未见稳定公开统一 UA 观察阿里相关来源与访问模式
腾讯元宝 暂未见稳定公开统一 UA 结合腾讯系来源、引用结果与日志排查
讯飞星火、秘塔搜索 暂未见稳定公开统一 UA 作为观察项,不直接做强白名单

这张表的核心不是“背 UA”,而是区分三类:官方明确、行业可观察、尚不稳定。例如 Cloudflare 的 AI 爬虫识别资料提到,很多 AI 机器人会使用定义清晰的 UA 字符串,但站点仍应结合日志和访问行为判断,可参考 Cloudflare 关于检测 AI 爬虫的说明

如果你需要更完整的国产 AI UA 归类,可以结合站内的国产AI爬虫UA识别与WAF白名单配置继续扩展。

为什么不能只靠 UA 放行或拦截?

UA 是“声明”,不是“身份证”。任何脚本都可以伪造 BytespiderKimi-User 或普通浏览器 UA,因此只按字符串放行,容易把恶意采集器也放进来。

一线排查中更常见的问题有三种:

  1. 误拦真实爬虫:WAF 把非浏览器访问全部拦掉,导致 AI 无法读取官网信息。
  2. 误信伪造 UA:攻击脚本伪装成 AI 爬虫,绕过基础规则。
  3. 放行范围过大:把登录页、搜索页、参数页也放开,增加性能和数据风险。

robots.txt 也不是防火墙。RFC 9309 Robots Exclusion Protocol定义的是爬虫访问偏好表达方式,合规爬虫会参考它,但它不能阻止不遵守规则的访问者。

因此,国内大模型爬虫 user agent 的正确用法是:用于分流和观察,而不是替代安全验证

三证据核验法:从“像爬虫”到“可放行”

判断一个 AI 爬虫是否值得放行,可以使用“三证据核验法”:身份证据、行为证据、结果证据。三项越完整,放行范围越可以扩大。

国内大模型爬虫 user agent 三证据核验矩阵

1. 身份证据:UA、IP 与反向解析

先看请求是否携带稳定 UA,再看来源 IP、ASN、反向 DNS 是否与平台归属相符。对没有公开文档的平台,不要因为 UA 名称“看起来像官方”就信任。

建议记录字段:

  • time_local
  • remote_addr
  • http_user_agent
  • request_uri
  • status
  • body_bytes_sent
  • request_time
  • http_referer

如果你正在排查 403、挑战页或验证码误伤,可对照站内的大模型抓取 403 四层归因方法逐层定位。

2. 行为证据:访问路径、频率与状态码

真实 AI 抓取通常会集中访问首页、产品页、文档页、博客页、FAQ、关于我们等公共信息页。异常流量则更可能扫登录接口、后台路径、站内搜索和大量参数 URL。

一个可执行的判断口径是:

  • 访问公共内容页,频率平稳:可观察或小范围放行;
  • 高频访问动态参数页:限速或缓存;
  • 命中登录、支付、用户中心:继续拦截;
  • 大量 403/429:检查 WAF 是否误伤;
  • 大量 5xx:先做限速和缓存保护。

Bytespider 这类较常见 UA,推荐先看 7 天日志,而不是当天看到一次就改全站规则。

3. 结果证据:AI 是否真的引用或改写了页面

最终要看 AI 搜索结果是否发生变化:品牌是否被提及、页面是否被引用、事实是否被正确描述。只看到爬虫访问,不等于已经进入答案。

MaxAEO 的国内版 maxaeo.cn 覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi、智谱清言、讯飞星火和秘塔搜索 9 个国产 AI 平台,可监测品牌提及率、排序、情绪评价与引用来源。站点也支持AI 爬虫访问被拦截的排查思路,适合把日志证据和 AI 回答证据连起来看。

robots.txt 应该怎么写?

robots.txt 的目标不是“尽量多写 UA”,而是把公开内容、低价值路径和敏感路径分清楚。对不确定的国内大模型爬虫,优先使用通用规则兜底。

一个稳妥示例:

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /checkout/
Disallow: /search?
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

如果确认某个 UA 可信,可以单独给公开内容目录更清晰的规则:

User-agent: Bytespider
Allow: /blog/
Allow: /docs/
Allow: /product/
Disallow: /admin/
Disallow: /login/
Disallow: /api/

注意两点:

  • 不要把私有接口、订单页、用户数据页暴露给任何爬虫;
  • 不要因为某个平台没有公开 UA,就把 User-agent: * 全部禁止。

如果还在评估是否支持 crawl-delay,可以参考站内的AI爬虫 crawl-delay 支持现状与限速方案

WAF 白名单如何最小化配置?

WAF 放行应遵循“最小权限”:只放行需要被 AI 理解的公开内容,不放行账户、交易、搜索和接口路径。UA 只作为条件之一。

推荐配置顺序:

  1. 先建观察规则:命中 UA 时只打标签,不立即放行。
  2. 再做目录放行:仅允许 /blog//docs//product/ 等内容页。
  3. 设置频率限制:按 IP、UA、路径组合限速。
  4. 保留安全挑战:对登录、支付、后台、API 继续执行强规则。
  5. 每周复核日志:看 403、429、5xx 是否异常升高。

一个 Nginx 观察规则示例:

map $http_user_agent $is_ai_crawler {
    default 0;
    ~*Bytespider 1;
    ~*Kimi-User 1;
    ~*Kimibot 1;
    ~*MoonshotBot 1;
    ~*ChatGLM-Spider 1;
}

这段规则只适合打标或分流,不建议直接等同于“可信”。如遇 Cloudflare、阿里云盾、腾讯云 WAF 等产品误伤,可先看站内的WAF误伤机器人流量排查与最小放行策略

SaaS 官网的一手排查口径:先保“可读”,再追“被引”

SaaS 官网做 AI 可见性时,最容易犯的错是只盯 UA 清单,却忽略页面是否适合被 AI 摘取。真正影响答案的,往往是“能不能抓到”和“抓到后能不能理解”。

MaxAEO 在 SaaS 与工具类品牌的 AI 搜索可见性方案中,会把排查拆成四步:锁基线、定打法、上内容、看回声。对应到爬虫场景,就是:

阶段 要回答的问题 核心证据
锁基线 当前 AI 是否提到品牌? 9 平台实测、原始回答
定打法 哪些页面值得开放给 AI? 官网、文档、FAQ、案例页
上内容 AI 缺哪些结构化信息? 对比表、定义块、价格口径、适用场景
看回声 改动后是否被引用? 提及率、推荐位次、引用 URL

这套口径的增量在于:不把爬虫访问当终点,而把“AI 是否正确引用品牌信息”当验收点。否则,即使日志里出现了国内大模型爬虫 user agent,也不能证明品牌在 AI 答案里获得了有效曝光。

常见问题

DeepSeek 有固定爬虫 UA 吗?

截至本文更新日,公开可稳定核验的 DeepSeek 专属爬虫 UA 并不明确。建议不要编造 DeepSeekBot 一类规则,而是保证公开页面可访问,并用日志与 AI 回答结果交叉验证。

豆包通常看哪个 UA?

字节系抓取常见可观察标识是 Bytespider。但它仍然需要结合 IP、访问路径和频率判断,不建议看到该字符串就全站无条件放行。

Kimi-User 可以直接加入白名单吗?

不建议直接全站放行。更稳妥的做法是先记录 7–14 天访问日志,确认它主要访问公开内容页,再对低风险目录做有限放行。

robots.txt 禁止 AI 爬虫就一定生效吗?

不一定。robots.txt 是协议偏好表达,不是强制访问控制。合规爬虫会遵守,但恶意爬虫可以无视它,所以敏感路径仍应依赖权限、鉴权和 WAF。

如何判断 AI 已经抓取并使用了我的页面?

看三类证据:服务器日志出现相关访问、页面状态码为 200、AI 回答中出现品牌提及或引用来源。MaxAEO 支持按平台监测提及率、排序、情绪和引用来源,可用于复测优化效果。

小结:UA 清单只是起点,引用验证才是终点

国内大模型爬虫 user agent 的价值,在于帮助站长从海量日志中识别可能的 AI 抓取流量。但它不是安全凭证,也不是 AI 可见性的最终证明。

更可靠的流程是:先用 UA 建观察名单,再用日志和 WAF 规则确认访问质量,最后用 AI 平台实测验证品牌是否被正确提及、排序和引用。这样既能减少误拦,又能避免把风险流量误放进生产环境。