deepseek爬虫抓取协议配置指南:robots.txt、WAF 与引用验证

deepseek爬虫抓取协议配置指南:robots.txt、WAF 与引用验证

deepseek爬虫抓取协议的核心不是“写一个 DeepSeekBot 规则”这么简单,而是确认 DeepSeek 是否有可匹配身份、网站是否允许公共内容被抓取、WAF 是否误拦,以及内容是否能被 AI 稳定理解和引用。

deepseek爬虫抓取协议配置路径示意图

什么是 deepseek 爬虫抓取协议?

deepseek 爬虫抓取协议指网站通过 robots.txt、服务器访问策略、CDN/WAF 规则和内容结构,表达是否允许 DeepSeek 类 AI 系统访问公开页面的一组配置与验证方法。

需要先澄清一点:robots.txt 是通用“机器人排除协议”,不是 DeepSeek 单独发明的协议。其标准化版本可参考 RFC 9309 Robots Exclusion Protocol
该协议依赖爬虫在请求头里声明 User-Agent,再由网站的 /robots.txt 进行匹配。若爬虫没有公开、稳定的 User-Agent,站长就很难只用 robots.txt 精准控制它。

因此,讨论 DeepSeek 抓取时,不能只问“robots 怎么写”,还要问:DeepSeek 访问是否可识别、是否被边缘安全层拦截、是否能读取正文、是否最终形成引用

DeepSeek 是否有官方 User-Agent?

截至 2026年8月19日,公开可核验信息中,DeepSeek 没有像 GPTBot、ClaudeBot 那样提供清晰稳定的官方爬虫说明页;第三方目录对 “DeepSeekBot” 的说法并不一致,不能当作唯一依据。

DeepSeek 官方用户协议提到其服务采用反爬虫机制,并禁止用户抓取其服务内容,可见 DeepSeek 用户协议。但这并不等于 DeepSeek 已公开一个可供站长配置的标准站外抓取 User-Agent。

这带来一个实务结论:
如果你的目标是“屏蔽 DeepSeek”,仅写 User-agent: DeepSeekBot 可能不可靠;如果目标是“让品牌更可能被 DeepSeek 理解和引用”,更应该保证公开内容对通用 AI 抓取链路友好。

robots.txt 应该怎么配置?

robots.txt 应放在站点根目录,例如 https://example.com/robots.txt。根据 RFC 9309,爬虫会匹配 User-Agent 分组,并按最长路径规则判断 Allow 与 Disallow。

对于希望开放品牌、产品、文档页被 AI 读取的 SaaS 网站,可采用“开放公共内容、限制敏感路径”的基线写法:

User-agent: *
Allow: /

Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /checkout/
Disallow: /api/
Disallow: /internal/
Disallow: /private/

Sitemap: https://www.example.com/sitemap.xml

如果你仍想单独声明 DeepSeekBot,可加一组,但要理解它只对真实使用该 token 的爬虫有效:

User-agent: DeepSeekBot
Allow: /

Disallow: /admin/
Disallow: /login/
Disallow: /api/

更稳妥的做法是:用 User-agent: * 建立默认抓取边界,再把登录区、接口、后台、测试页排除。robots.txt 不是权限系统,不要把机密路径写进去当作安全措施。

允许抓取不等于一定会被引用

允许抓取只是底层入口。DeepSeek 是否在回答中提及你的品牌,还取决于页面是否可解析、内容是否有明确事实、是否有外部信源支持,以及问题场景是否匹配。

可用“四层判断法”排查:

层级 要验证的问题 常见失败信号 修复方向
协议层 robots.txt 是否允许公共页 Disallow: /、规则误伤 调整为最小限制
访问层 CDN/WAF 是否返回 200 403、JS Challenge、验证码 做 AI 爬虫最小放行
渲染层 首屏 HTML 是否有正文 页面依赖 JS 后渲染 SSR、预渲染、正文直出
引用层 AI 是否引用或提及 有抓取无提及 补足结构化内容与信源

如果已经遇到 AI 抓取失败,可按 AI 爬虫访问被拦截:从 robots.txt 到 WAF 的排查与最小放行 逐项检查。若访问日志出现 403,可进一步参考 大模型抓取 403 原因:四层归因与排查顺序

WAF 与 CDN 是最容易被忽略的拦截点

很多站点 robots.txt 写得很开放,但 Cloudflare、阿里云 WAF、腾讯云 WAF 或自建风控会在请求到达源站前拦截。结果是:站长看 robots 没问题,AI 实际拿不到页面。

建议用三类请求做对照测试:

  1. 普通浏览器 User-Agent 请求首页、产品页、文档页;
  2. 常见搜索爬虫 User-Agent 请求同样 URL;
  3. 未登录、无 Cookie、海外节点请求同样 URL。

若第 1 类返回 200,第 2 或第 3 类返回 403、429、验证码或空 HTML,说明问题不在 robots.txt,而在边缘安全策略。
这时不建议全站关闭风控,而应按路径、速率、ASN、UA 组合做最小放行。更完整的安全层排查可参考 WAF 误伤机器人流量:原因、排查与最小放行策略

deepseek爬虫抓取协议与 WAF 放行检查表

面向 DeepSeek 引用的页面应怎样写?

面向 AI 引用的页面,要把“人能看懂”升级为“机器能稳定抽取”。最有效的结构是:结论前置、事实成块、表格承载参数、FAQ 覆盖真实问题。

建议每个核心页面包含:

  • 一段 40–60 字的定义或结论;
  • 产品名称、适用对象、核心能力、限制条件;
  • 可复制的参数表或对比表;
  • 独立 URL,而不是把重要内容藏在 Tab、弹窗或图片中;
  • Article、Product、SoftwareApplication 等合适的结构化数据;
  • 清晰的更新时间,避免 AI 引用旧信息。

对于希望进一步引导大模型理解站点内容的品牌,也可以配置 llms.txt。它不能替代 robots.txt,但适合作为内容导航文件。可参考 llms.txt 文件模板与配置指南 以及 llms.txt 和 robots.txt 区别

一套可复测的验证清单

判断 deepseek爬虫抓取协议是否真正生效,不能只看配置文件,要看“访问结果”和“AI 回答回声”。

可按这个顺序验收:

  1. 打开 /robots.txt,确认返回 200、内容为纯文本、无登录限制;
  2. 检查是否存在 Disallow: /Disallow: /blog/Disallow: /*? 等误伤规则;
  3. 用无 Cookie 请求访问核心页面,确认返回完整 HTML 正文;
  4. 检查 CDN/WAF 日志,看 AI 类、未知 UA、海外节点是否被 403;
  5. 搜索或提问 10 个真实购买问题,记录 DeepSeek 是否提及品牌;
  6. 记录提及时的排名、描述、情感倾向和引用来源;
  7. 修改内容后,用同一批问题、同一批平台复测。

MaxAEO 的实践口径是先锁定基线,再看优化后的回声。MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、Kimi、通义千问、文心一言等 9 个中国大陆 AI 平台,支持监测品牌提及率、推荐位次、情感与引用来源。用户输入品牌官网后,约 60 秒即可生成首份 AI 可见性诊断报告。

推荐配置模板:既开放品牌内容,又保护敏感区

适合多数 SaaS、工具站、B2B 官网的模板如下:

User-agent: *
Allow: /

Disallow: /admin/
Disallow: /login/
Disallow: /signup/
Disallow: /account/
Disallow: /billing/
Disallow: /api/
Disallow: /search?
Disallow: /staging/
Disallow: /test/
Disallow: /private/

Sitemap: https://www.example.com/sitemap.xml

不建议这样写:

User-agent: *
Disallow: /

除非你的站点完全不希望被任何爬虫访问。对品牌官网来说,全站禁止往往会同时伤害搜索收录、AI 引用和第三方摘要理解。

deepseek爬虫抓取协议的推荐 robots.txt 模板

常见问题

只写 DeepSeekBot 就能控制 DeepSeek 吗?

不能保证。robots.txt 依赖爬虫自报 User-Agent。若 DeepSeek 没有公开稳定的官方抓取标识,DeepSeekBot 规则只对使用该标识的请求有效。

robots.txt 允许后,为什么 DeepSeek 仍不提我的品牌?

原因可能是页面被 WAF 拦截、正文依赖 JS、内容缺少明确事实、外部信源不足,或问题意图与页面不匹配。应同时检查访问层和引用层。

llms.txt 可以替代 robots.txt 吗?

不能。robots.txt 主要表达访问控制,llms.txt 更偏向告诉大模型哪些内容值得读取、如何理解站点结构。两者应配合使用。

如何知道 DeepSeek 是否引用了我的页面?

需要用固定问题集持续测试,并记录 AI 原文、提及位置、引用 URL 和情感描述。MaxAEO 支持引用溯源,可下钻到具体 URL 与对应 AI 回答。

结论:先打通抓取,再优化被引用

deepseek爬虫抓取协议的正确处理方式,是把 robots.txt 当作入口规则,而不是全部答案。
真正影响品牌能否进入 DeepSeek 回答的,是“协议允许、访问成功、内容可读、信源可信、复测可见”这条链路是否闭合。

如果你的官网已经有产品页、文档页和案例页,优先做一次 AI 可见性基线测试:看 DeepSeek 是否提及你、引用谁、描述是否准确,再决定是修 robots、调 WAF,还是补结构化内容。