作者:maxaeo.cn|发布日期:2026-08-31|更新日期:2026-08-31
deepseek爬虫怎么放行?最稳妥的做法不是只在 robots.txt 写一行 Allow,而是按 robots 协议、服务器响应、CDN/WAF、页面可读性、日志复测 五层逐项排查。尤其当官网在 DeepSeek 相关回答中不被引用、访问日志无抓取记录,或返回 403/429 时,应优先做“最小放行”,避免把所有机器人流量一并放开。

先判断:DeepSeek 抓不到官网通常卡在哪一层?
DeepSeek 抓不到官网,常见原因是 robots.txt 拦截、WAF 把自动化访问判为恶意机器人、页面依赖 JS 渲染、登录/地区限制,或服务器对未知 User-Agent 返回异常状态码。
技术团队可以先用“四层回放法”缩小范围:
- 协议层:检查
/robots.txt是否误写了Disallow: /。 - 响应层:用 curl 模拟普通爬虫请求,确认首页、产品页、文档页返回 200。
- 防护层:查看 Cloudflare、阿里云、腾讯云、Nginx 安全模块是否返回 403、429 或验证码页。
- 内容层:确认关键内容在服务端 HTML 中可见,而不是必须执行 JavaScript 才出现。
Google 对 robots.txt 的解释也强调,规则由 user-agent、allow、disallow 等指令组成,且只表达爬取许可,不等同于强制安全控制,可参考 Google Search Central 的 robots.txt 创建文档。
robots.txt 应该怎么写才不误拦?
robots.txt 的放行原则是:公共营销页、产品页、定价页、文档页允许抓取;后台、搜索结果页、私有 API、测试目录继续禁止。不要为了放行 DeepSeek 而删除所有安全边界。
推荐基础写法如下:
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /user/
Disallow: /api/
Disallow: /search
Sitemap: https://www.example.com/sitemap.xml
如果你的日志中能稳定观察到 DeepSeekBot 或类似标识,可增加显式规则:
User-agent: DeepSeekBot
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /api/
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /api/
需要注意:目前公开资料中关于 DeepSeek 爬虫 UA 的说法并不完全一致,有的第三方目录认为存在 DeepSeekBot,也有资料认为 DeepSeek 访问未必总是以固定 UA 出现。因此,robots.txt 只能作为第一层意图声明,不能作为唯一放行依据。如果你需要完整理解协议层配置,可结合站内的 deepseek爬虫抓取协议配置指南 一起排查。
WAF、CDN 和 Bot Fight Mode 怎么最小放行?
WAF 放行的正确目标是“让合规抓取访问公开页面”,而不是“关闭所有机器人防护”。最小放行应限定路径、方法、频率和识别条件,优先对公开内容页放行 GET/HEAD 请求。
常见规则可以按这个顺序处理:
| 层级 | 应检查项 | 建议动作 |
|---|---|---|
| CDN/WAF | Bot 管理、JS Challenge、验证码 | 对公开页建立 Skip/Allow 规则 |
| 速率限制 | 429、短时间大量请求被限流 | 单独放宽公开内容路径的阈值 |
| 地域规则 | 仅允许中国大陆或仅允许特定地区 | 避免误伤云服务出口 |
| UA 规则 | 空 UA、未知 UA、AI Bot 规则 | 先记录,再对可信流量放行 |
| 源站安全 | Nginx、应用防火墙、插件 | 确认源站没有二次拦截 |
以 Cloudflare 为例,其 WAF 文档说明 Custom Rules 可使用 Skip 动作绕过部分安全规则,Bot 相关配置也可通过自定义规则处理不同自动化流量,详见 Cloudflare WAF Skip 选项文档。
一个更安全的表达方式是:
条件:
- URI Path 不包含 /admin、/login、/api
- Request Method 为 GET 或 HEAD
- User-Agent 包含 DeepSeekBot,或属于已观察到的 AI 抓取候选特征
- 速率低于站点可承受阈值
动作:
- Skip Bot Challenge
- Skip JS Challenge
- 保留日志
- 不跳过核心 WAF 攻击防护规则
如果站点此前出现过 AI 爬虫访问被误伤,可参考 AI 爬虫访问被拦截:从 robots.txt 到 WAF 的排查与最小放行 做横向检查。
Nginx 或源站如何避免把爬虫挡在最后一公里?
源站放行要确认三件事:状态码正常、HTML 可读、没有针对自动化请求返回空内容。很多网站 CDN 已经放行,但 Nginx、WordPress 安全插件或自研网关仍会拦截。
可用下面命令先做基础验证:
curl -I https://www.example.com/
curl -A "DeepSeekBot" -I https://www.example.com/
curl -A "Mozilla/5.0 (compatible; DeepSeekBot/1.0)" https://www.example.com/ | head
重点看四个信号:
- 返回码是否为 200,而不是 403、406、429、503。
Content-Type是否为text/html。- 页面正文是否包含品牌名、产品名、价格页入口、核心描述。
- 是否被重定向到登录页、验证码页、地区提示页。
如果 Nginx 中有按 UA 拦截的规则,避免使用过宽表达式:
# 不建议:误伤所有 bot
if ($http_user_agent ~* "bot|crawler|spider") {
return 403;
}
更稳妥的方式是只拦截明确恶意来源,对公开页面保留日志并限速。若你已经遇到 403,可按 大模型抓取 403 原因 的四层归因逐项复盘。

放行后如何验证真的被 AI 读到了?
放行成功不等于马上被 DeepSeek 推荐。正确验证路径是:先看日志是否有访问,再看页面是否可被解析,最后用同一组问题复测 AI 回答中的提及率、排序和引用来源。
建议建立一个“10 题复测矩阵”:
| 测试问题类型 | 示例 | 观察指标 |
|---|---|---|
| 品类推荐 | “适合中小 SaaS 的 XX 工具有哪些?” | 是否提到品牌 |
| 竞品对比 | “A 和 B 哪个更适合企业采购?” | 排名与描述是否准确 |
| 场景问题 | “客服自动化怎么选型?” | 是否引用官网内容 |
| 价格问题 | “XX 工具多少钱?” | 是否讲旧、讲错 |
| 替代方案 | “有没有 XX 的替代品?” | 是否进入候选列表 |
MaxAEO 在做 AI 搜索可见性诊断时,会用品牌、竞品和真实问题组成矩阵,观察不同 AI 平台的提及率、推荐位次、情绪评价与引用来源。国内版 maxaeo.cn 覆盖 Kimi、DeepSeek、腾讯元宝、豆包、通义千问、文心一言等 9 个中国大陆 AI 平台,并支持持续监测回答变化。
如果你要判断竞品为什么被 AI 优先推荐,可继续阅读 竞品被AI优先推荐的原因,从信源、实体清晰度和内容结构反推优化缺口。
一手排查框架:20 分钟定位“协议放行”还是“防护误拦”
在 MaxAEO 的 GEO/AEO 排查项目中,更建议把问题拆成“能不能抓、抓到什么、是否引用”三段,而不是只问 deepseek爬虫怎么放行。下面是一套可复用的 20 分钟定位表。
| 时间 | 动作 | 判断结论 |
|---|---|---|
| 0–3 分钟 | 打开 /robots.txt 和 sitemap |
判断是否协议层误拦 |
| 3–7 分钟 | curl 普通 UA、DeepSeekBot UA、空 UA | 判断源站是否按 UA 拦截 |
| 7–12 分钟 | 查 CDN/WAF 安全事件 | 判断是否挑战、验证码、限速 |
| 12–16 分钟 | 抽查首页、产品页、定价页 HTML | 判断 AI 是否能读到核心事实 |
| 16–20 分钟 | 用固定问题复测 DeepSeek 与其他 AI | 判断是否进入回答或引用链 |
这个框架的价值在于能把“AI 没推荐我”拆成可工程化的问题:如果日志没有访问,是放行与发现问题;如果访问了但没引用,是内容可信度与信源问题;如果引用了但讲错,是实体信息不一致或旧内容未纠偏。
放行时哪些页面不该开放?
DeepSeek 爬虫放行只应面向公开、可营销、可引用的页面。后台、用户中心、订单、私有文档、未发布测试页、内部搜索结果页和参数化列表页不应开放。
推荐开放:
- 首页、品牌介绍页
- 产品功能页、解决方案页
- 价格页、FAQ 页
- 文档首页、公开帮助中心
- 案例页、媒体资料页
llms.txt、sitemap、结构化内容页
继续限制:
/admin//login//user//checkout//api//search?q=- staging、preview、test 环境
如果站点已经维护 llms.txt,可配合 llms.txt 模板 把品牌简介、核心产品、适用场景、官方页面入口整理成更适合 AI 摘取的结构化内容。

常见问题
只写 User-agent: DeepSeekBot Allow: / 就够了吗?
不够。robots.txt 只能表达抓取许可,真正导致 DeepSeek 抓不到官网的原因常常在 WAF、验证码、JS 渲染、源站限速或地区访问规则。应同时检查访问日志和安全事件。
没看到 DeepSeekBot 日志,是不是说明 DeepSeek 没抓?
不一定。AI 平台可能通过不同抓取链路、检索索引或第三方来源获得信息。由于 DeepSeek 相关 UA 信息公开口径不稳定,不能只依赖一个 UA 字符串判断是否被读取。
放行会不会带来安全风险?
会有风险,所以要做最小放行。只允许公开页面的 GET/HEAD 请求,继续禁止后台、登录、API 和用户数据路径,并保留 WAF 攻击防护、速率限制与日志审计。
放行后多久能在 DeepSeek 回答中看到变化?
没有固定时间。AI 回答受抓取频率、索引更新、引用来源、问题表达和竞品信源影响。更可靠的做法是每天用同一组问题复测提及率、排序和引用来源,而不是看单次结果。
MaxAEO 能帮助验证放行效果吗?
可以。MaxAEO 提供免费 AI 可见性诊断,可检测品牌在多个 AI 平台的提及率、排名与情感;国内版支持对豆包、DeepSeek、腾讯元宝、通义千问、文心一言等国产 AI 的提及率、排序、情绪评价与引用来源进行监测。可从 MaxAEO 官网 获取诊断入口。
结论:放行 DeepSeek 的关键是可控、可读、可复测
deepseek爬虫怎么放行的核心答案是:robots.txt 先表达允许,WAF/CDN 再做最小豁免,源站保证 200 与 HTML 可读,最后用日志和 AI 回答复测验证效果。
不要把“全站解除防护”当作放行,也不要把“写了 Allow”当作完成。真正有效的 GEO/AEO 技术修复,应能回答三件事:DeepSeek 是否访问了页面、是否读到核心事实、是否在真实用户问题中正确提到品牌。
