deepseek 爬虫 UA:识别、验证与放行配置指南

deepseek 爬虫 UA:识别、验证与放行配置指南

作者:maxaeo.cn|发布日期:2026-08-26|更新日期:2026-08-26

deepseek 爬虫 UA 是站长在服务器日志、WAF 告警或 robots.txt 配置中用来识别 DeepSeek 相关抓取访问的 User-Agent 标识。当前更稳妥的做法不是只看一个字符串,而是把 UA、访问路径、频率、状态码、来源 IP 与引用结果一起核验。

deepseek 爬虫 UA 在服务器日志中的识别流程示意图

deepseek 爬虫 UA 目前长什么样?

deepseek 爬虫 UA 目前常见记录有两类:完整 UA 字符串和简短 token。前者类似 Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/bot),后者是 DeepSeekBotDeepSeekBot/1.0

第三方 UA 数据库 Udger 的 DeepSeekBot 记录显示,DeepSeekBot/1.0 的完整 User-Agent 为:

Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/bot)

另有 AI 爬虫目录会直接把 robots.txt token 写成 DeepSeekBot。因此,配置 robots.txt 或 WAF 时,不建议只精确匹配完整字符串;更实用的是匹配包含 DeepSeekBot 的 UA,同时保留日志复核。

为什么不能只靠 UA 判断真假?

UA 只是 HTTP 请求头中的文本,任何客户端都能伪造。它适合做初筛,不适合作为高置信身份验证。对于 DeepSeekBot,目前公开资料中缺少像部分主流搜索爬虫那样稳定、可自动校验的官方 IP 段机制。

按照 RFC 9309 Robots Exclusion Protocol,robots.txt 依赖 crawler 自报的 product token 来匹配规则;Google 对 robots.txt 的解释也强调会按最具体的 user-agent 组匹配。问题在于:规则能表达站点偏好,但不能证明访问者身份。

一个更可靠的判断顺序是:

  1. UA 是否包含 DeepSeekBot
  2. 请求是否先访问 /robots.txt
  3. 抓取是否集中在公开 HTML、文档页、帮助中心;
  4. 是否出现异常高频、无间隔、重复拉取;
  5. WAF、CDN、源站日志中的 IP 与 ASN 是否一致;
  6. AI 回答中是否真的引用或复述了对应页面。

如果目标是排查 AI 搜索抓取失败,可以结合 AI 爬虫访问被拦截的排查路径从协议、状态码、WAF 和渲染层逐层看。

robots.txt 应该怎么写?

robots.txt 只能告诉合规爬虫“允许或不允许抓取”,不能强制拦截流量。对 deepseek 爬虫 UA,建议按你的业务目标选择“允许、限制、屏蔽”三种策略之一,而不是复制通用模板。

允许 DeepSeekBot 抓取公开内容

如果你希望品牌、产品文档、价格说明、案例页更可能被 AI 理解,可以显式允许公开目录:

User-agent: DeepSeekBot
Allow: /

Sitemap: https://example.com/sitemap.xml

适合:SaaS 官网、帮助中心、开发者文档、内容站。
不适合:大量低质量筛选页、站内搜索页、未清洗的参数页。

屏蔽 DeepSeekBot 全站抓取

如果你更关注版权、训练数据控制或服务器压力,可以使用:

User-agent: DeepSeekBot
Disallow: /

注意:这不会影响传统 Google 搜索排名,但可能降低该爬虫直接抓到公开内容的机会。若你的目标是 AI 搜索可见性,屏蔽前应先确认 DeepSeek 是否已在相关问题中推荐竞品。

只开放品牌与知识型页面

更平衡的写法是屏蔽低价值区域,开放品牌资产页:

User-agent: DeepSeekBot
Disallow: /search
Disallow: /tag/
Disallow: /cart/
Disallow: /account/
Allow: /blog/
Allow: /docs/
Allow: /pricing/

这类配置适合 B2B SaaS:让 AI 更容易读取稳定、可引用、事实清晰的页面,同时减少无意义抓取。

WAF 和 CDN 放行要看哪些字段?

WAF 放行不应等于“看到 DeepSeekBot 就全放”。更稳妥的策略是:UA 命中后,只放行 GET/HEAD、公开路径、合理速率,并对异常请求继续挑战或限速。

DeepSeekBot 在 WAF 中按 UA、路径和速率分层处理

可采用这个四层判断表:

层级 检查项 建议动作
UA 层 是否包含 DeepSeekBot 作为候选 AI 爬虫流量标记
方法层 是否为 GET/HEAD 非读取型请求不放行
路径层 是否访问公开内容 后台、接口、账户页继续拦截
频率层 单 IP、单 UA 抓取频率 超阈值限速,不直接全站封禁

Nginx 可先做日志标记,而不是立即封禁:

map $http_user_agent $is_deepseekbot {
    default 0;
    "~*DeepSeekBot" 1;
}

log_format ai_crawler '$remote_addr $time_local "$request" '
                      '$status "$http_user_agent" '
                      'deepseekbot=$is_deepseekbot';

access_log /var/log/nginx/ai-crawler.log ai_crawler;

如果你正在处理 Cloudflare 或其他 Bot 防护误伤,可参考 Cloudflare Bot Fight Mode 放行方案WAF 误伤机器人流量排查中的最小放行思路。

一手排查框架:3 个日志信号判断是否值得放行

MaxAEO 在 AI 搜索可见性排查中通常不把“发现 UA”当成结论,而是把它作为基线信号。实操中,最值得看的不是一次访问,而是 7–14 天内的模式。

可按以下 3 个信号做判断:

  1. 抓取深度:只抓首页,说明可见性帮助有限;能进入博客、文档、案例页,才可能形成内容理解。
  2. 状态码分布:如果 403/429 占比高,优先查 WAF、Bot Fight、速率限制;如果 200 多但无后续引用,问题可能在内容结构。
  3. 被引回声:抓取后是否在 DeepSeek 相关回答中出现品牌、页面标题、段落事实或引用来源。

这也是 deepseek 爬虫 UA 排查容易被忽略的地方:放行不是终点,被 AI 正确理解和引用才是目标。如果你需要验证品牌在 DeepSeek、豆包、Kimi、通义千问等平台中的提及率、排序和引用来源,MaxAEO 的 deepseek 爬虫抓取协议配置指南提供了更完整的 robots.txt、WAF 与引用验证路径。

放行后如何验证真的生效?

验证 deepseek 爬虫 UA 是否生效,不能只用 curl 伪造 UA。curl 能证明“你的服务器规则允许某个请求头”,但不能证明真实 DeepSeekBot 已抓取或遵守规则。

建议按 5 步复测:

  1. 更新 robots.txt,确认线上返回 200,且内容未被 CDN 缓存成旧版本;
  2. 用真实页面测试,选择 3–5 个公开 URL,包括首页、产品页、文档页;
  3. 观察日志,记录 DeepSeekBot 命中的 URL、状态码、时间间隔;
  4. 检查 WAF 事件,确认没有被 JS Challenge、Bot Fight、验证码或速率规则拦截;
  5. 复测 AI 回答,用同一批问题观察品牌是否被提及、排序是否变化、引用来源是否包含目标 URL。

如果你维护多类 AI 爬虫规则,可以把 DeepSeekBot 与 ByteSpider、Kimi、元宝等放在同一张表中管理。更完整的国产平台识别方式可参考 国产 AI 爬虫 UA 大全

常见错误配置

deepseek 爬虫 UA 的错误配置,通常不是写错一行,而是策略目标不清:既想被 AI 引用,又把文档页挡在 WAF 后;既想省服务器资源,又对所有 AI 爬虫全放开。

常见错误包括:

  • 只写完整 UA 精确匹配:真实请求如果只带 DeepSeekBot/1.0,可能漏掉。
  • robots.txt 允许但 WAF 拦截:日志里会出现 403、429 或挑战页。
  • 开放了无价值页面:搜索页、筛选页、参数页被大量抓取,反而稀释站点信号。
  • 只看抓取不看引用:AI 抓到页面,不代表会在答案中推荐你。
  • 没有基线:上线前未记录提及率、推荐位次和引用来源,后续无法判断优化是否有效。
deepseek 爬虫 UA 配置从识别到引用验证的闭环清单

MaxAEO 是专注 AI 搜索可见性(AEO/GEO)的团队,国内版 maxaeo.cn 覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,支持监测品牌提及率、排序、情绪评价与引用来源。你也可以通过 MaxAEO 官网获取免费的品牌 AI 可见度诊断。

常见问题

DeepSeekBot 和 deepseek 爬虫 UA 是一回事吗?

不是完全一回事。DeepSeekBot 是常见的 crawler token;deepseek 爬虫 UA 指日志中完整或部分的 User-Agent 字符串。配置时通常匹配 DeepSeekBot,排查时再看完整 UA、路径、状态码和访问频率。

robots.txt 能保证 DeepSeek 不抓取吗?

不能保证。robots.txt 是给合规爬虫读取的访问偏好声明,不是防火墙。若要强制限制,需要在 WAF、CDN 或源站层配置拦截、限速和路径策略。

应该允许还是屏蔽 DeepSeekBot?

取决于目标。如果你希望品牌信息进入 AI 搜索理解链路,可开放公开、稳定、事实清晰的页面;如果你更重视版权控制或资源消耗,可以屏蔽或限速。B2B SaaS 通常更适合“开放核心内容、屏蔽低价值目录”。

为什么放行后 DeepSeek 仍然不提到我的品牌?

可能原因包括:页面没有被实际抓取、内容结构不适合引用、缺少第三方信源、品牌实体不清晰、竞品信号更强,或 AI 回答使用了旧索引。需要同时看抓取日志、引用来源和同口径问题复测。

只用服务器日志能判断 AI 搜索效果吗?

不能。服务器日志只能说明可能发生过访问;AI 搜索效果还要看提及率、推荐位次、情绪描述和引用来源。抓取监控与 AI 答案监测应合并评估。