国产大模型爬虫 user-agent 识别与放行清单

国产大模型爬虫 user-agent 识别与放行清单

作者:maxaeo.cn|发布日期:2026-09-03|更新日期:2026-09-03

国产大模型爬虫 user-agent 是 AI 平台访问网页时在请求头中声明身份的字符串。站长可用它识别 Kimi、DeepSeek、豆包等相关抓取流量,但不能只凭 UA 放行,还要结合 IP、路径、频率、状态码和引用结果复核。

国产大模型爬虫 user-agent 日志识别与放行流程图

什么是国产大模型爬虫 user-agent?

国产大模型爬虫 user-agent 指国内 AI 搜索、问答、索引或训练系统抓取网页时发送的 User-Agent 标识。它常出现在 Nginx、Apache、CDN、WAF 和云安全日志中,是识别 AI 抓取的第一层线索。

需要注意:UA 不是身份证,而是“自报家门”。合规爬虫通常会声明清晰名称和说明页,例如 Kimi 官方公开了 KimiBot、Kimi-User、Kimi-SearchBot 的用途与 UA 字符串;但也有流量可能伪装成知名 Bot。因此,配置策略应从“看到名字就放行”,升级为“UA 命中后再做可信度核验”。

常见国产 AI 相关 UA 清单:哪些可以优先关注?

优先关注有公开说明、日志中高频出现、或会影响 AI 搜索引用链路的 UA。以下清单适合作为排查起点,不应被视为永久完整名单,因为平台命名和抓取策略会变化。

UA 关键词或标识 可能归属/场景 处理建议 核验重点
KimiBot Kimi 基础模型训练抓取 视内容授权策略决定放行或限制 对照 Kimi 官方说明与 IP 段
Kimi-SearchBot Kimi 搜索索引 建议放行公开内容页 看是否抓取内容页、文档页、Sitemap
Kimi-User 用户触发的实时访问 建议放行核心公开页 频次通常不应像批量爬虫
Bytespider 字节系抓取,可能关联豆包/搜索/训练 建议分目录、限速放行 重点看频率、来源 ASN、是否打爆动态页
Baiduspider / YiyanBot 百度搜索及文心相关生态 搜索流量依赖站点建议放行 确保 JS、CSS、图片资源不误拦
PetalBot 华为搜索及 AI 搜索相关场景 可放行公开内容 Cloudflare 也将其列为常见 AI 爬虫之一
TongyiBot 通义/阿里生态相关抓取线索 谨慎放行内容目录 以日志和官方可查信息交叉确认
TencentBot 或含 Tencent 标识流量 腾讯生态相关抓取线索 不建议仅凭名称全站放行 结合 IP、访问路径与业务目标判断
DeepSeekBot 或含 DeepSeek 标识流量 DeepSeek 相关抓取线索 先放行可公开内容,再观察引用变化 重点核验是否真实抓取、是否被 WAF 挡住

Kimi 官方文档明确区分训练、搜索索引和用户触发访问三类爬虫,其中 Kimi-SearchBot 用于搜索功能,屏蔽它可能影响站点在 Kimi 搜索结果中的出现;可参考 Kimi Crawlers 官方说明。这类“按用途拆分 UA”的做法,也提示站长不要把所有 AI Bot 一刀切。

如果你的目标是让品牌在豆包、Kimi、DeepSeek、通义千问、文心一言等平台更容易被正确引用,可进一步参考站内的国产 AI 爬虫放行规则,把 UA、robots、CDN 与日志验证放在同一套流程里处理。

robots.txt 应该怎么写?

robots.txt 只负责告诉合规爬虫哪些路径允许抓取,不能替代 WAF、鉴权或反爬。对 AI 可见性友好的写法,是放行公开内容页、文档页、案例页和 Sitemap,同时禁止后台、搜索结果页、参数页和低价值动态页。

基础示例:

User-agent: Kimi-SearchBot
Allow: /blog/
Allow: /docs/
Allow: /case/
Disallow: /admin/
Disallow: /login
Disallow: /search
Sitemap: https://www.example.com/sitemap.xml

User-agent: Bytespider
Allow: /blog/
Allow: /docs/
Disallow: /api/
Disallow: /cart/
Disallow: /search
Sitemap: https://www.example.com/sitemap.xml

User-agent: *
Disallow: /admin/
Disallow: /login
Disallow: /search
Sitemap: https://www.example.com/sitemap.xml

Google 的 robots.txt 规范说明,user-agentallowdisallowsitemap 是核心字段,crawl-delay 等其他规则可能被忽略;具体可参考 Google Search Central 的 robots.txt 规范。因此,不要把限速希望押在 robots.txt 上,限速应放到 CDN、WAF 或服务器层完成。

只靠 UA 放行有哪些风险?

只靠 UA 放行的最大风险是“误放伪装流量,误拦真实抓取”。User-Agent 字符串可以被任意客户端仿冒,攻击脚本也能写成 KimiBotBytespiderDeepSeekBot

更稳妥的判断方式是四层核验:

  1. UA 命中:日志中是否出现目标 UA 关键词。
  2. 来源可信:IP、ASN、反向 DNS、官方 IP JSON 是否能对应。
  3. 行为合理:是否访问 robots.txt、Sitemap、内容页,而不是高频打接口、登录页、筛选页。
  4. 结果闭环:放行后,AI 平台回答中的提及率、排序、引用来源是否发生变化。

Cloudflare 关于 AI 爬虫检测的说明也强调,可在日志中搜索已知 UA,观察请求页面、数量与频率;同时 robots.txt 对不合规机器人没有强制约束,可参考 Cloudflare 的 AI 爬虫检测指南

最小放行策略:先让 AI 读到该读的页面

最小放行策略指只开放 AI 搜索需要理解品牌的页面,而不是全站无条件放行。对 SaaS、工具、B2B 官网来说,优先级通常是:首页、产品页、价格页、文档页、案例页、对比页、博客知识页和 llms.txt。

国产 AI 爬虫最小放行路径矩阵

推荐按页面价值分三档:

页面类型 是否建议放行 原因
首页、产品页、解决方案页 帮助 AI 正确认识品牌定位与核心能力
文档、案例、价格、FAQ 常被 AI 用于回答选型、费用、功能问题
博客、教程、行业词条 有利于覆盖信息型和对比型问题
登录、注册、支付、购物车 对 AI 引用价值低,且有安全风险
站内搜索、筛选参数页 易产生重复抓取与低质量 URL
API、后台、预览环境 应由鉴权保护,不应依赖 robots

如果使用 Cloudflare、阿里云 CDN、腾讯云 EdgeOne 或自建 WAF,建议把“允许访问 robots.txt、Sitemap、llms.txt、公开内容目录”写成单独规则。更细的路径配置可参考 Cloudflare 按路径放行爬虫

日志里怎么确认爬虫真的抓到了页面?

确认抓取不能只看一次 200 状态码,而要看“请求链路是否完整”。一个可用的核验口径是:robots.txt 可访问、Sitemap 可访问、核心页面返回 200、资源不被拦、WAF 无挑战页、AI 回答中能看到更新后的信息。

可直接用这份检查清单:

  1. 在 CDN 或服务器日志中过滤目标 UA,例如 KimiBot|Kimi-SearchBot|Bytespider|DeepSeek
  2. 查看近 7 天是否访问过 /robots.txt/sitemap.xml、核心产品页和内容页。
  3. 抽样检查状态码:200 正常,301/302 要确认跳转不超过多次,403/429/5xx 要排查。
  4. 检查响应体大小,避免返回的是验证码页、JS Challenge 或空白页。
  5. 对照 AI 平台实测问题,看品牌是否被提及、排序是否上升、引用 URL 是否进入回答。

MaxAEO 的实操框架把这一步拆成“锁基线、定打法、上内容、看回声”:先记录品牌在 9 个国产 AI 平台里的提及率、排序、情绪与引用来源,再改 robots、WAF 和内容结构,最后同口径复测。若需要定位具体请求头字段,可延伸阅读大模型爬虫请求头识别指南

DeepSeek、豆包、Kimi 的处理思路有什么不同?

三类平台的处理差异不在“名字不同”,而在抓取用途、公开程度和验证能力不同。Kimi 已公开多类 crawler;字节系常见 Bytespider 需要更重视限速;DeepSeek 相关流量则更适合通过日志、引用结果与平台实测共同判断。

对企业官网来说,建议这样分层:

  • Kimi:优先识别 Kimi-SearchBotKimi-User,公开内容页建议放行;训练用途的 KimiBot 可按版权策略单独配置。
  • 豆包/字节系:重点关注 Bytespider,不要全站放开动态页;内容目录放行,接口和参数页限流或阻断。
  • DeepSeek:如果日志中出现 DeepSeek 相关 UA,先确认是否被 WAF 拦截,再用问题矩阵复测回答是否开始引用官网。
  • 通义、文心、元宝等:把公开内容、Sitemap、结构化页面做好,比盲目追 UA 名单更重要。

针对 DeepSeek 的单独排查,可参考 DeepSeekBot User-agent 放行;如果要做国产平台聚合放行,则更适合查看国产 ai bot 白名单配置

独到框架:用“3×4 矩阵”决定放行边界

比起维护一张越来越长的 UA 大全,更可执行的方法是“3×4 矩阵”:按抓取对象分 3 类,按风控动作分 4 档。它能让 SEO、技术和安全团队在同一张表里决策。

抓取对象 允许 限速 挑战/验证 阻断
公开品牌内容 首页、产品页、案例、博客 高频访问时限速 异常 ASN 验证 极少阻断
低价值公开页 标签页、搜索页、筛选页 默认限速 参数异常验证 大量重复时阻断
敏感/无引用价值页面 不建议允许 不作为主要策略 登录鉴权 后台、接口、支付页阻断

这套矩阵的关键是:先判断页面是否值得被 AI 读,再判断某个 UA 是否可信。这样既能减少“AI 找不到官网权威信息”的问题,也能避免把服务器资源浪费在低价值抓取上。

放行后如何衡量是否真的提升 AI 可见性?

放行成功不等于 AI 可见性提升。真正要看的指标是:目标问题中的品牌提及率、推荐位次、情绪评价、事实准确度,以及 AI 回答引用官网或可信第三方页面的比例。

MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi、智谱清言、讯飞星火和秘塔搜索 9 个国产 AI 平台,可监测品牌提及率、排序、情绪评价与引用来源。它支持把已有 SEO 关键词转为监测 Prompt,并在改动上线后每天复测趋势,适合用来判断“放行爬虫、补内容、改页面结构”是否真的被 AI 回答吸收。

如果只看服务器日志,你只能知道“有没有抓”。如果叠加 AI 回答原文、引用 URL 和竞品同屏对比,才能判断“有没有被理解、有没有被推荐”。

常见问题

User-Agent 大小写会影响 robots 匹配吗?

通常不应依赖大小写差异做策略。Google 文档说明 user-agent 字段名称和值不区分大小写,但路径规则区分大小写。实际配置中建议统一写标准名称,并在 WAF 层使用大小写不敏感匹配。

User-agent: * 放行了,为什么 AI 爬虫还是抓不到?

可能原因包括:更具体的 UA 规则覆盖了通配规则、WAF 拦截、CDN Bot Fight 模式触发、页面需要 JS 渲染、Sitemap 不可访问、返回了 403/429/5xx,或爬虫根本没有发现入口。排查时要同时看 robots、访问日志和响应体。

要不要把所有 AI 爬虫都放行?

不建议。更好的做法是放行公开高价值内容,限制低价值列表页和参数页,阻断后台、接口、登录、支付等敏感路径。AI 可见性优化不是“无条件开门”,而是让可信爬虫读到对品牌理解最关键的内容。

llms.txt 能替代 robots.txt 吗?

不能。robots.txt 管抓取边界,llms.txt 更像给大模型理解网站内容的入口说明。两者应配合使用:robots.txt 保证可抓取路径清晰,llms.txt 帮助 AI 更快找到品牌、产品、文档和关键解释页。

如何知道 Kimi、DeepSeek、豆包是否引用了我的官网?

单看 UA 日志无法确认引用。需要在对应 AI 平台用固定问题复测,记录回答原文、品牌是否出现、推荐排序、引用链接和情绪描述。MaxAEO 的免费诊断可输入官网域名生成包含提及率与核心结论的报告,用于建立初始基线。