作者:maxaeo.cn|发布日期:2026-08-31|更新日期:2026-08-31
DeepSeekBot User-Agent 放行的核心不是“看到 DeepSeekBot 就全放”,而是先用 robots.txt 表达允许,再在 WAF/CDN 中做路径、频率和来源校验,最后用日志复测是否真实抓到关键页面。 这样既能降低 AI 搜索抓取失败,也能避免被伪造 UA 绕过防护。

什么是 DeepSeekBot User-Agent?
DeepSeekBot User-Agent 指请求头中用于声明 DeepSeek 相关爬虫身份的字符串。它通常被站长用于 robots.txt、WAF、CDN、Nginx 或日志分析中的爬虫识别。
目前公开资料对 DeepSeekBot 的描述并不完全一致。KnownAgents 的 DeepSeekBot 页面列出过形如 Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/bot) 的 UA;Botcrawl 的 DeepSeekBot 记录则强调其身份为观测型、可信度较低,并提示不要只信任 UA。
因此,DeepSeekBot User-Agent 放行应被视为“条件放行”,而不是无条件白名单。UA 可以作为第一层筛选,但不应成为唯一判断依据。
为什么不能只靠 UA 白名单?
UA 是客户端自报字段,任何脚本都可以伪造。只按 DeepSeekBot 放行,可能让非 DeepSeek 请求绕过 Bot 防护、限速和访问控制。
更稳妥的判断方式是三层叠加:
| 层级 | 判断对象 | 建议动作 |
|---|---|---|
| 身份层 | User-Agent 是否包含 DeepSeekBot | 只作为初筛 |
| 行为层 | 是否先访问 robots.txt、抓取频率是否异常 | 异常时限速或挑战 |
| 资源层 | 是否访问公开内容页,而非后台、接口、搜索页 | 仅放行可公开抓取路径 |
在 MaxAEO 的 AI 抓取排查实践中,最常见的误区是“为了让 AI 收录,直接放开全站”。更安全的做法是只放行品牌页、产品页、文档页、博客页和 llms.txt 等公开信息层,不放行登录态页面、管理后台、站内搜索结果和高成本接口。
robots.txt 应该怎么写?
robots.txt 负责表达抓取意愿,但它不是强制安全边界。想让 DeepSeekBot 抓公开内容,可以显式允许核心目录,同时屏蔽无价值或敏感路径。
示例:
User-agent: DeepSeekBot
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /api/
Disallow: /search
Disallow: /*?*
User-agent: *
Disallow: /admin/
Disallow: /login/
Disallow: /api/
这段配置的意思是:允许 DeepSeekBot 访问主体内容,但不鼓励抓后台、登录、接口、搜索和参数页。若你还在整理大模型友好的内容入口,可参考 llms.txt 模板与配置指南 补充结构化入口。
需要注意:robots.txt 依赖爬虫自觉遵守。若日志显示仍有高频异常访问,应在 WAF/CDN 或源站层做限速,而不是只改 robots.txt。
WAF/CDN 中如何做最小放行?
WAF/CDN 的放行目标是“让公开内容可被抓”,不是让所有 DeepSeekBot 请求绕过安全策略。规则应同时限制 UA、路径、方法和频率。
以 Cloudflare 为例,官方文档建议使用自定义规则处理 User-Agent 条件,而不是依赖旧式 UA Blocking;可参考 Cloudflare WAF User-Agent Blocking 文档 的表达式思路。
一个更稳妥的条件可以写成:
(http.user_agent contains "DeepSeekBot"
and http.request.method in {"GET" "HEAD"}
and not starts_with(http.request.uri.path, "/admin")
and not starts_with(http.request.uri.path, "/api")
and not starts_with(http.request.uri.path, "/login"))
动作不要直接选择“绕过全部安全检查”。更推荐:
- 对公开内容路径:允许或跳过 Bot Fight 类强挑战;
- 对后台、接口、登录页:继续阻断;
- 对异常高频访问:返回 429,而不是永久封禁;
- 对未知 DeepSeek 变体 UA:进入观察或限速队列。
如果你的站点已经出现 AI 爬虫访问被误拦,可以对照 AI 爬虫访问被拦截排查指南 从 robots.txt、CDN、WAF、源站四层定位。

Nginx 源站如何兜底?
Nginx 适合做最后一层兜底:不要把 UA 放行写成“全站免检”,而是给公开路径、静态页面和限速区分策略。
示例:
map $http_user_agent $is_deepseekbot {
default 0;
"~*DeepSeekBot" 1;
}
limit_req_zone $binary_remote_addr zone=ai_crawler:10m rate=1r/s;
server {
location ~ ^/(admin|login|api)/ {
if ($is_deepseekbot) { return 403; }
}
location / {
if ($is_deepseekbot) {
set $allow_ai_crawl 1;
}
limit_req zone=ai_crawler burst=10 nodelay;
try_files $uri $uri/ =404;
}
}
这不是唯一写法,但体现了关键原则:公开内容可抓,敏感路径不抓,高频请求限速。如果你遇到 403、JS 挑战或 Bot Fight Mode 误伤,也可以参考 Cloudflare Bot Fight Mode 放行方案 做最小修复。
如何验证放行真的生效?
验证 DeepSeekBot User-Agent 放行是否有效,要看日志,而不是只看配置界面显示“已保存”。建议连续观察 7 天,并记录请求状态码、路径、UA、IP、Referer、响应耗时和命中规则。
一个可复用的复测清单:
- 协议层:访问
/robots.txt,确认 DeepSeekBot 规则没有被缓存旧版本覆盖。 - 入口层:确认首页、产品页、博客页、
/llms.txt返回 200。 - 防护层:确认后台、登录、接口仍返回 403、401 或挑战。
- 频率层:单 IP 高频请求是否触发 429。
- 引用层:后续在 AI 平台提问时,检查品牌信息是否更完整、是否引用了正确页面。
MaxAEO 在品牌 AI 可见性诊断中通常采用“问题矩阵 × 多平台实测”的方法:先锁定基线,再调整内容与抓取条件,最后同口径复测。对于国内站点,MaxAEO 国内版覆盖 Kimi、DeepSeek、腾讯元宝、豆包、通义千问、文心一言等 9 个中国大陆 AI 平台,可用于观察提及率、排序、情绪评价与引用来源变化。若需要排查更完整的 AI 抓取链路,可结合 deepseek 爬虫抓取协议配置指南 一起看。
一个一手排查案例:放行后仍没有被引用怎么办?
在一个 SaaS 官网排查中,WAF 已允许包含 DeepSeekBot 的 GET 请求访问内容页,但 AI 回答仍长期引用第三方评测页,而不是官网。日志复核后发现,官网产品页虽然返回 200,但核心卖点由前端接口渲染,原始 HTML 只有空容器。
修复动作分三步:
- 将产品定义、适用人群、价格口径、FAQ 放入服务端渲染 HTML;
- 在 llms.txt 中补充官网核心页面入口;
- 保持同一组 10 个购买意图问题,每天复测 AI 回答中的提及率和引用 URL。
这个案例说明:DeepSeekBot User-Agent 放行只能解决“能不能进门”,不能保证“抓到可理解内容”。AI 搜索优化还要同时解决页面可读性、实体一致性和引用源可信度。
推荐的放行策略:四象限判断
DeepSeekBot UA 放行可以按“内容价值 × 安全风险”分成四类,避免一刀切。
| 页面类型 | 示例 | 建议策略 |
|---|---|---|
| 高价值、低风险 | 首页、产品页、文档、案例、博客 | 放行并监测 |
| 高价值、中风险 | 价格页、下载页、开放资料库 | 放行但限速 |
| 低价值、低风险 | 标签页、分页、重复列表 | 可抓但降低优先级 |
| 低价值、高风险 | 后台、接口、搜索结果、订单页 | 阻断 |
如果目标是提升 AI 搜索中的品牌可见性,重点不是让爬虫抓更多页面,而是让它抓到更准确、更结构化、更能回答用户问题的页面。MaxAEO 提供免费 AI 可见性诊断,输入官网域名约 60 秒可生成包含提及率与核心结论的报告,并可进一步通过引用溯源查看 AI 偏好引用哪些站点与页面。

常见问题
DeepSeekBot User-Agent 放行会提升搜索排名吗?
不会直接提升传统搜索排名。它主要影响 AI 抓取、理解和引用公开内容的机会。是否被 AI 回答采用,还取决于内容质量、信源可信度、实体一致性和竞品对比语境。
只在 robots.txt 写 Allow 就够了吗?
不够。robots.txt 是声明,不是防火墙。真实环境中还可能被 CDN Bot 防护、WAF 规则、源站限速、JS 渲染和地区策略拦截,必须结合日志验证。
能不能直接把 DeepSeekBot 加入全站白名单?
不建议。UA 可被伪造,全站白名单会放大安全风险。更推荐按公开路径放行,保留后台、接口、登录页的阻断规则,并对高频请求做 429 限速。
放行后多久能看到 AI 回答变化?
没有固定时间。AI 平台抓取、索引、生成和引用都有延迟。更可复核的方法是先记录基线,再用同一组问题每天观察提及率、推荐位次和引用来源变化。
如何判断是 WAF 拦截还是内容不可读?
看两类证据:日志里是否有 403、429、JS 挑战或 Bot 规则命中;页面原始 HTML 中是否包含核心信息。如果状态码正常但 AI 仍讲错,问题往往在内容结构和信源一致性。
