DeepSeekBot User-agent 怎么写:robots.txt 放行、屏蔽与避坑清单

DeepSeekBot User-agent 怎么写:robots.txt 放行、屏蔽与避坑清单

作者:maxaeo.cn|发布日期:2026-08-31|更新日期:2026-08-31

**DeepSeekBot User-agent 怎么写?**在 robots.txt 里通常写 User-agent: DeepSeekBot,再按目标配置 AllowDisallow。但更重要的是:不要只看文件写没写对,还要验证日志、WAF、CDN 与实际抓取结果是否一致。

DeepSeekBot User-agent 怎么写的 robots.txt 配置示意图

DeepSeekBot User-agent 应该写成什么

DeepSeekBot 的 robots.txt 匹配令牌通常写作 DeepSeekBot。如果目标是允许访问,可写 Allow: /;如果目标是禁止全站抓取,可写 Disallow: /

基础放行写法:

User-agent: DeepSeekBot
Allow: /

全站屏蔽写法:

User-agent: DeepSeekBot
Disallow: /

需要注意的是,当前公开资料对 DeepSeekBot 的身份确认并不完全一致。有的机器人目录记录了 DeepSeekBot 或完整 UA 字符串,有的资料则提示 DeepSeek 未稳定公开可验证的官方爬虫标识。因此,User-agent: DeepSeekBot 适合作为规则表达,但不能代替真实访问验证。

如果你还不了解 DeepSeek 抓取协议与 robots.txt、WAF 的关系,可以先看这篇站内指南:deepseek爬虫抓取协议配置指南

放行、屏蔽、限速分别怎么写

robots.txt 只能表达“允许或不允许抓取”的偏好,不能强制执行安全策略。放行、屏蔽和限速应分层处理:robots.txt 管规则,WAF/CDN 管拦截,日志管验证。

常见场景可以这样配置:

目标 robots.txt 示例 适用情况 仍需检查
允许 DeepSeekBot 抓取公开内容 User-agent: DeepSeekBot + Allow: / 希望提升 AI 搜索可见性 WAF 是否误拦
禁止 DeepSeekBot 全站抓取 User-agent: DeepSeekBot + Disallow: / 不希望内容被该类爬虫访问 是否有匿名 UA 绕过
只屏蔽后台与私有路径 Disallow: /admin/Disallow: /private/ 公开内容可抓,敏感路径不可抓 路径大小写与真实 URL
控制高频访问 robots.txt 表达规则,限速放在 CDN/Nginx/WAF 请求量影响性能 429、403 是否误伤正常用户

Google 对 robots.txt 的解释强调,爬虫会选择与自身 UA 最匹配的规则组;AllowDisallow 的归属取决于前面的 User-agent 分组。可参考 Google Search Central 的 robots.txt 规范说明

为什么写了规则仍可能放行失败

写了 User-agent: DeepSeekBot 不等于一定生效。失败通常不是语法本身,而是“匹配对象、执行层级、验证口径”三者不一致。

最常见的 6 类问题:

  1. UA 没匹配上:真实日志里的 UA 不是 DeepSeekBot,而是浏览器式 UA、大小写变体或没有明显标识。
  2. 规则组写乱了:多个 User-agent 混在一起,导致规则被合并或落到错误分组。
  3. 路径写错/Private//private/ 在很多服务器上不是同一路径。
  4. robots.txt 被缓存:CDN 仍返回旧版本,导致新规则没有被爬虫看到。
  5. WAF 先拦截:robots.txt 允许,但 WAF/Bot Fight Mode 返回 403。
  6. 只看配置不看结果:没有核对访问日志、状态码、抓取路径与后续 AI 引用变化。

RFC 9309 将 robots.txt 定义为 Robots Exclusion Protocol,并说明该协议依赖爬虫按规则解析和遵守;它不是鉴权、防火墙或隐私保护机制。可参考 RFC 9309 原文

MaxAEO 的 12 组配置复核结论

为避免“看起来正确、实际无效”,MaxAEO 按技术 SEO 排查口径复核了 12 组常见 DeepSeekBot 写法,重点看三项:是否能被标准 robots 解析器识别、是否容易误伤其他爬虫、是否便于日志复测。

复核结论如下:

写法 判断 原因
User-agent: DeepSeekBot + Allow: / 推荐 语义清晰,适合公开内容放行
User-agent: DeepSeekBot + Disallow: / 推荐 适合表达全站拒绝
User-agent: DeepSeekBot/1.0 不推荐 robots.txt 通常匹配产品令牌,不宜写完整版本号
User-agent: DeepSeek 谨慎 可能匹配不到实际 UA,也可能扩大影响范围
User-agent: deepseekbot 可作为兼容补充 多数解析器大小写处理较宽松,但不应只写小写
User-agent: * + Disallow: / 高风险 会影响所有遵守规则的爬虫
只写 Allow: / 不写 UA 无效 规则没有明确归属
用 meta 标签替代 robots.txt 不推荐 不能等同于爬取控制
只在 WAF 放行不改 robots.txt 不完整 能访问不代表你表达了抓取策略
只改 robots.txt 不看日志 不完整 无法确认是否真的抓到或被拦
屏蔽 /api//admin//login/ 推荐 适合作为安全底线
同时配置 sitemap 推荐 有利于公开内容被发现,但不保证被引用

这里的关键不是“多写几个变体”,而是先明确目标:你是要让 DeepSeek 类 AI 更容易理解公开内容,还是要限制训练型抓取?如果你正在处理国产 AI 平台的爬虫识别,也可以参考这份国产ai爬虫ua大全

推荐的最小可用模板

多数 SaaS 官网、内容站、电商站,不建议一上来全站屏蔽。更稳妥的模板是:公开内容允许,后台、账户、搜索结果页、参数页限制,敏感访问交给服务端权限控制。

User-agent: DeepSeekBot
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /checkout/
Disallow: /search
Disallow: /*?*

Sitemap: https://www.example.com/sitemap.xml

如果你明确不希望 DeepSeekBot 抓取任何页面:

User-agent: DeepSeekBot
Disallow: /

Sitemap: https://www.example.com/sitemap.xml

如果你希望只开放内容目录、屏蔽其他区域:

User-agent: DeepSeekBot
Allow: /blog/
Allow: /docs/
Disallow: /

这类“先 Disallow: / 再局部 Allow”的写法要格外小心。不同解析器会按路径匹配规则判断优先级,建议上线前用测试工具和真实日志双重验证。

DeepSeekBot robots.txt 放行与屏蔽模板对比

robots.txt 之外还要检查 WAF 和日志

DeepSeekBot UA 写对后,下一步是看请求有没有被服务器链路放行。AI 爬虫抓取失败,很多时候发生在 CDN、WAF、Nginx、反向代理或安全插件层。

建议按这个顺序排查:

  1. 打开 https://你的域名/robots.txt,确认线上版本已更新。
  2. 在访问日志中搜索 DeepSeekBotdeepseek、相关大小写变体。
  3. 查看状态码:200 代表可访问,403 多为拦截,429 多为限速,5xx 多为服务端错误。
  4. 对比路径:确认被抓页面是不是你希望开放的页面。
  5. 检查 WAF 规则:不要用“未知 Bot 一律拦截”覆盖 robots.txt 放行意图。
  6. 复测 AI 回答:观察品牌是否被提及、排序是否变化、引用来源是否出现官网或内容页。

如果你遇到“robots.txt 已放行但 AI 抓取仍 403”,可沿着AI 爬虫访问被拦截的排查路径逐层定位;涉及 Cloudflare 时,也可参考Cloudflare Bot Fight Mode 放行的最小修复方案。

从“允许抓取”到“被 AI 引用”还差什么

允许 DeepSeekBot 抓取,只是 AI 可见性的入口,不等于品牌一定会被推荐。AI 系统还会看内容是否可解析、信息是否一致、是否有可信来源支撑,以及同类品牌中谁更符合用户问题。

更可执行的做法是建立三张表:

  • 问题表:用户会问哪些选型、对比、价格、替代方案、教程类问题。
  • 页面表:每个问题对应官网、博客、文档、案例或 FAQ 哪个 URL。
  • 引用表:AI 回答里实际引用了哪些域名、页面和句子。

MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,可监测品牌提及率、推荐位次、情绪评价与引用来源。对于 SaaS 与工具类品牌,更建议把 UA 配置和 AI 搜索监测放在同一个复盘周期里看,而不是只改一次 robots.txt 就结束。

MaxAEO 也支持用户注册后获取免费的品牌 AI 可见性诊断报告,用于查看品牌在 AI 平台中的提及率、排名与核心结论。需要做竞品维度复盘时,可以结合ai 搜索竞品监测方法建立长期指标。

上线前检查清单

DeepSeekBot User-agent 写法上线前,按“策略、语法、链路、结果”四层检查。只要其中一层没有验证,就可能出现规则正确但效果错误。

  • 策略层:确认是放行、屏蔽、局部开放,还是限速。
  • 语法层:User-agentAllowDisallow 是否属于同一规则组。
  • 路径层:后台、账户、订单、搜索、参数页是否被正确限制。
  • 缓存层:CDN 是否返回最新版 robots.txt。
  • WAF 层:安全策略是否误拦目标 UA。
  • 日志层:是否能看到目标 UA、路径、状态码和访问频率。
  • AI 层:是否复测 DeepSeek 等平台的回答提及与引用来源变化。
DeepSeekBot User-agent 上线前检查清单

常见问题

DeepSeekBot User-agent 怎么写才最稳妥?

最稳妥的基础写法是 User-agent: DeepSeekBot,再根据目标写 Allow: /Disallow: /。不要把完整浏览器 UA、版本号或注释混进匹配令牌里。

写了 Allow: / 就一定会被 DeepSeek 引用吗?

不一定。Allow: / 只表示允许合规爬虫抓取,不保证内容会进入索引、训练数据或回答引用。是否被引用还取决于页面质量、信息结构、信源权威性和用户问题匹配度。

可以只靠 robots.txt 屏蔽 DeepSeekBot 吗?

不建议只靠 robots.txt。robots.txt 是协议声明,不是强制访问控制。涉及敏感数据时,应使用登录权限、服务端鉴权、WAF、IP 策略和响应状态码共同控制。

是否需要同时写 DeepSeekBotdeepseekbot

通常优先写标准形式 DeepSeekBot。如果你的日志里长期出现小写或变体 UA,可以增加独立规则组作为兼容,但不要用过宽的 DeepSeek 规则误伤其他请求。

配置后多久能看到 AI 搜索变化?

没有固定时间。UA 放行只能解决访问入口问题,AI 回答变化还受抓取频率、模型更新、引用源更新和问题采样影响。更可靠的方式是每天用同一组问题复测提及率、排序和引用来源。