作者:maxaeo.cn|发布日期:2026-08-26|更新日期:2026-08-26
deepseek 爬虫 UA 是站长在服务器日志、WAF 告警或 robots.txt 配置中用来识别 DeepSeek 相关抓取访问的 User-Agent 标识。当前更稳妥的做法不是只看一个字符串,而是把 UA、访问路径、频率、状态码、来源 IP 与引用结果一起核验。

deepseek 爬虫 UA 目前长什么样?
deepseek 爬虫 UA 目前常见记录有两类:完整 UA 字符串和简短 token。前者类似 Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/bot),后者是 DeepSeekBot 或 DeepSeekBot/1.0。
第三方 UA 数据库 Udger 的 DeepSeekBot 记录显示,DeepSeekBot/1.0 的完整 User-Agent 为:
Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/bot)
另有 AI 爬虫目录会直接把 robots.txt token 写成 DeepSeekBot。因此,配置 robots.txt 或 WAF 时,不建议只精确匹配完整字符串;更实用的是匹配包含 DeepSeekBot 的 UA,同时保留日志复核。
为什么不能只靠 UA 判断真假?
UA 只是 HTTP 请求头中的文本,任何客户端都能伪造。它适合做初筛,不适合作为高置信身份验证。对于 DeepSeekBot,目前公开资料中缺少像部分主流搜索爬虫那样稳定、可自动校验的官方 IP 段机制。
按照 RFC 9309 Robots Exclusion Protocol,robots.txt 依赖 crawler 自报的 product token 来匹配规则;Google 对 robots.txt 的解释也强调会按最具体的 user-agent 组匹配。问题在于:规则能表达站点偏好,但不能证明访问者身份。
一个更可靠的判断顺序是:
- UA 是否包含
DeepSeekBot; - 请求是否先访问
/robots.txt; - 抓取是否集中在公开 HTML、文档页、帮助中心;
- 是否出现异常高频、无间隔、重复拉取;
- WAF、CDN、源站日志中的 IP 与 ASN 是否一致;
- AI 回答中是否真的引用或复述了对应页面。
如果目标是排查 AI 搜索抓取失败,可以结合 AI 爬虫访问被拦截的排查路径从协议、状态码、WAF 和渲染层逐层看。
robots.txt 应该怎么写?
robots.txt 只能告诉合规爬虫“允许或不允许抓取”,不能强制拦截流量。对 deepseek 爬虫 UA,建议按你的业务目标选择“允许、限制、屏蔽”三种策略之一,而不是复制通用模板。
允许 DeepSeekBot 抓取公开内容
如果你希望品牌、产品文档、价格说明、案例页更可能被 AI 理解,可以显式允许公开目录:
User-agent: DeepSeekBot
Allow: /
Sitemap: https://example.com/sitemap.xml
适合:SaaS 官网、帮助中心、开发者文档、内容站。
不适合:大量低质量筛选页、站内搜索页、未清洗的参数页。
屏蔽 DeepSeekBot 全站抓取
如果你更关注版权、训练数据控制或服务器压力,可以使用:
User-agent: DeepSeekBot
Disallow: /
注意:这不会影响传统 Google 搜索排名,但可能降低该爬虫直接抓到公开内容的机会。若你的目标是 AI 搜索可见性,屏蔽前应先确认 DeepSeek 是否已在相关问题中推荐竞品。
只开放品牌与知识型页面
更平衡的写法是屏蔽低价值区域,开放品牌资产页:
User-agent: DeepSeekBot
Disallow: /search
Disallow: /tag/
Disallow: /cart/
Disallow: /account/
Allow: /blog/
Allow: /docs/
Allow: /pricing/
这类配置适合 B2B SaaS:让 AI 更容易读取稳定、可引用、事实清晰的页面,同时减少无意义抓取。
WAF 和 CDN 放行要看哪些字段?
WAF 放行不应等于“看到 DeepSeekBot 就全放”。更稳妥的策略是:UA 命中后,只放行 GET/HEAD、公开路径、合理速率,并对异常请求继续挑战或限速。

可采用这个四层判断表:
| 层级 | 检查项 | 建议动作 |
|---|---|---|
| UA 层 | 是否包含 DeepSeekBot |
作为候选 AI 爬虫流量标记 |
| 方法层 | 是否为 GET/HEAD | 非读取型请求不放行 |
| 路径层 | 是否访问公开内容 | 后台、接口、账户页继续拦截 |
| 频率层 | 单 IP、单 UA 抓取频率 | 超阈值限速,不直接全站封禁 |
Nginx 可先做日志标记,而不是立即封禁:
map $http_user_agent $is_deepseekbot {
default 0;
"~*DeepSeekBot" 1;
}
log_format ai_crawler '$remote_addr $time_local "$request" '
'$status "$http_user_agent" '
'deepseekbot=$is_deepseekbot';
access_log /var/log/nginx/ai-crawler.log ai_crawler;
如果你正在处理 Cloudflare 或其他 Bot 防护误伤,可参考 Cloudflare Bot Fight Mode 放行方案与 WAF 误伤机器人流量排查中的最小放行思路。
一手排查框架:3 个日志信号判断是否值得放行
MaxAEO 在 AI 搜索可见性排查中通常不把“发现 UA”当成结论,而是把它作为基线信号。实操中,最值得看的不是一次访问,而是 7–14 天内的模式。
可按以下 3 个信号做判断:
- 抓取深度:只抓首页,说明可见性帮助有限;能进入博客、文档、案例页,才可能形成内容理解。
- 状态码分布:如果
403/429占比高,优先查 WAF、Bot Fight、速率限制;如果200多但无后续引用,问题可能在内容结构。 - 被引回声:抓取后是否在 DeepSeek 相关回答中出现品牌、页面标题、段落事实或引用来源。
这也是 deepseek 爬虫 UA 排查容易被忽略的地方:放行不是终点,被 AI 正确理解和引用才是目标。如果你需要验证品牌在 DeepSeek、豆包、Kimi、通义千问等平台中的提及率、排序和引用来源,MaxAEO 的 deepseek 爬虫抓取协议配置指南提供了更完整的 robots.txt、WAF 与引用验证路径。
放行后如何验证真的生效?
验证 deepseek 爬虫 UA 是否生效,不能只用 curl 伪造 UA。curl 能证明“你的服务器规则允许某个请求头”,但不能证明真实 DeepSeekBot 已抓取或遵守规则。
建议按 5 步复测:
- 更新 robots.txt,确认线上返回 200,且内容未被 CDN 缓存成旧版本;
- 用真实页面测试,选择 3–5 个公开 URL,包括首页、产品页、文档页;
- 观察日志,记录
DeepSeekBot命中的 URL、状态码、时间间隔; - 检查 WAF 事件,确认没有被 JS Challenge、Bot Fight、验证码或速率规则拦截;
- 复测 AI 回答,用同一批问题观察品牌是否被提及、排序是否变化、引用来源是否包含目标 URL。
如果你维护多类 AI 爬虫规则,可以把 DeepSeekBot 与 ByteSpider、Kimi、元宝等放在同一张表中管理。更完整的国产平台识别方式可参考 国产 AI 爬虫 UA 大全。
常见错误配置
deepseek 爬虫 UA 的错误配置,通常不是写错一行,而是策略目标不清:既想被 AI 引用,又把文档页挡在 WAF 后;既想省服务器资源,又对所有 AI 爬虫全放开。
常见错误包括:
- 只写完整 UA 精确匹配:真实请求如果只带
DeepSeekBot/1.0,可能漏掉。 - robots.txt 允许但 WAF 拦截:日志里会出现 403、429 或挑战页。
- 开放了无价值页面:搜索页、筛选页、参数页被大量抓取,反而稀释站点信号。
- 只看抓取不看引用:AI 抓到页面,不代表会在答案中推荐你。
- 没有基线:上线前未记录提及率、推荐位次和引用来源,后续无法判断优化是否有效。

MaxAEO 是专注 AI 搜索可见性(AEO/GEO)的团队,国内版 maxaeo.cn 覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,支持监测品牌提及率、排序、情绪评价与引用来源。你也可以通过 MaxAEO 官网获取免费的品牌 AI 可见度诊断。
常见问题
DeepSeekBot 和 deepseek 爬虫 UA 是一回事吗?
不是完全一回事。DeepSeekBot 是常见的 crawler token;deepseek 爬虫 UA 指日志中完整或部分的 User-Agent 字符串。配置时通常匹配 DeepSeekBot,排查时再看完整 UA、路径、状态码和访问频率。
robots.txt 能保证 DeepSeek 不抓取吗?
不能保证。robots.txt 是给合规爬虫读取的访问偏好声明,不是防火墙。若要强制限制,需要在 WAF、CDN 或源站层配置拦截、限速和路径策略。
应该允许还是屏蔽 DeepSeekBot?
取决于目标。如果你希望品牌信息进入 AI 搜索理解链路,可开放公开、稳定、事实清晰的页面;如果你更重视版权控制或资源消耗,可以屏蔽或限速。B2B SaaS 通常更适合“开放核心内容、屏蔽低价值目录”。
为什么放行后 DeepSeek 仍然不提到我的品牌?
可能原因包括:页面没有被实际抓取、内容结构不适合引用、缺少第三方信源、品牌实体不清晰、竞品信号更强,或 AI 回答使用了旧索引。需要同时看抓取日志、引用来源和同口径问题复测。
只用服务器日志能判断 AI 搜索效果吗?
不能。服务器日志只能说明可能发生过访问;AI 搜索效果还要看提及率、推荐位次、情绪描述和引用来源。抓取监控与 AI 答案监测应合并评估。
