作者:maxaeo.cn|发布日期:2026-08-31|更新日期:2026-08-31
**DeepSeekBot User-agent 怎么写?**在 robots.txt 里通常写 User-agent: DeepSeekBot,再按目标配置 Allow 或 Disallow。但更重要的是:不要只看文件写没写对,还要验证日志、WAF、CDN 与实际抓取结果是否一致。

DeepSeekBot User-agent 应该写成什么
DeepSeekBot 的 robots.txt 匹配令牌通常写作 DeepSeekBot。如果目标是允许访问,可写 Allow: /;如果目标是禁止全站抓取,可写 Disallow: /。
基础放行写法:
User-agent: DeepSeekBot
Allow: /
全站屏蔽写法:
User-agent: DeepSeekBot
Disallow: /
需要注意的是,当前公开资料对 DeepSeekBot 的身份确认并不完全一致。有的机器人目录记录了 DeepSeekBot 或完整 UA 字符串,有的资料则提示 DeepSeek 未稳定公开可验证的官方爬虫标识。因此,User-agent: DeepSeekBot 适合作为规则表达,但不能代替真实访问验证。
如果你还不了解 DeepSeek 抓取协议与 robots.txt、WAF 的关系,可以先看这篇站内指南:deepseek爬虫抓取协议配置指南。
放行、屏蔽、限速分别怎么写
robots.txt 只能表达“允许或不允许抓取”的偏好,不能强制执行安全策略。放行、屏蔽和限速应分层处理:robots.txt 管规则,WAF/CDN 管拦截,日志管验证。
常见场景可以这样配置:
| 目标 | robots.txt 示例 | 适用情况 | 仍需检查 |
|---|---|---|---|
| 允许 DeepSeekBot 抓取公开内容 | User-agent: DeepSeekBot + Allow: / |
希望提升 AI 搜索可见性 | WAF 是否误拦 |
| 禁止 DeepSeekBot 全站抓取 | User-agent: DeepSeekBot + Disallow: / |
不希望内容被该类爬虫访问 | 是否有匿名 UA 绕过 |
| 只屏蔽后台与私有路径 | Disallow: /admin/、Disallow: /private/ |
公开内容可抓,敏感路径不可抓 | 路径大小写与真实 URL |
| 控制高频访问 | robots.txt 表达规则,限速放在 CDN/Nginx/WAF | 请求量影响性能 | 429、403 是否误伤正常用户 |
Google 对 robots.txt 的解释强调,爬虫会选择与自身 UA 最匹配的规则组;Allow、Disallow 的归属取决于前面的 User-agent 分组。可参考 Google Search Central 的 robots.txt 规范说明。
为什么写了规则仍可能放行失败
写了 User-agent: DeepSeekBot 不等于一定生效。失败通常不是语法本身,而是“匹配对象、执行层级、验证口径”三者不一致。
最常见的 6 类问题:
- UA 没匹配上:真实日志里的 UA 不是
DeepSeekBot,而是浏览器式 UA、大小写变体或没有明显标识。 - 规则组写乱了:多个
User-agent混在一起,导致规则被合并或落到错误分组。 - 路径写错:
/Private/与/private/在很多服务器上不是同一路径。 - robots.txt 被缓存:CDN 仍返回旧版本,导致新规则没有被爬虫看到。
- WAF 先拦截:robots.txt 允许,但 WAF/Bot Fight Mode 返回 403。
- 只看配置不看结果:没有核对访问日志、状态码、抓取路径与后续 AI 引用变化。
RFC 9309 将 robots.txt 定义为 Robots Exclusion Protocol,并说明该协议依赖爬虫按规则解析和遵守;它不是鉴权、防火墙或隐私保护机制。可参考 RFC 9309 原文。
MaxAEO 的 12 组配置复核结论
为避免“看起来正确、实际无效”,MaxAEO 按技术 SEO 排查口径复核了 12 组常见 DeepSeekBot 写法,重点看三项:是否能被标准 robots 解析器识别、是否容易误伤其他爬虫、是否便于日志复测。
复核结论如下:
| 写法 | 判断 | 原因 |
|---|---|---|
User-agent: DeepSeekBot + Allow: / |
推荐 | 语义清晰,适合公开内容放行 |
User-agent: DeepSeekBot + Disallow: / |
推荐 | 适合表达全站拒绝 |
User-agent: DeepSeekBot/1.0 |
不推荐 | robots.txt 通常匹配产品令牌,不宜写完整版本号 |
User-agent: DeepSeek |
谨慎 | 可能匹配不到实际 UA,也可能扩大影响范围 |
User-agent: deepseekbot |
可作为兼容补充 | 多数解析器大小写处理较宽松,但不应只写小写 |
User-agent: * + Disallow: / |
高风险 | 会影响所有遵守规则的爬虫 |
只写 Allow: / 不写 UA |
无效 | 规则没有明确归属 |
| 用 meta 标签替代 robots.txt | 不推荐 | 不能等同于爬取控制 |
| 只在 WAF 放行不改 robots.txt | 不完整 | 能访问不代表你表达了抓取策略 |
| 只改 robots.txt 不看日志 | 不完整 | 无法确认是否真的抓到或被拦 |
屏蔽 /api/、/admin/、/login/ |
推荐 | 适合作为安全底线 |
| 同时配置 sitemap | 推荐 | 有利于公开内容被发现,但不保证被引用 |
这里的关键不是“多写几个变体”,而是先明确目标:你是要让 DeepSeek 类 AI 更容易理解公开内容,还是要限制训练型抓取?如果你正在处理国产 AI 平台的爬虫识别,也可以参考这份国产ai爬虫ua大全。
推荐的最小可用模板
多数 SaaS 官网、内容站、电商站,不建议一上来全站屏蔽。更稳妥的模板是:公开内容允许,后台、账户、搜索结果页、参数页限制,敏感访问交给服务端权限控制。
User-agent: DeepSeekBot
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /checkout/
Disallow: /search
Disallow: /*?*
Sitemap: https://www.example.com/sitemap.xml
如果你明确不希望 DeepSeekBot 抓取任何页面:
User-agent: DeepSeekBot
Disallow: /
Sitemap: https://www.example.com/sitemap.xml
如果你希望只开放内容目录、屏蔽其他区域:
User-agent: DeepSeekBot
Allow: /blog/
Allow: /docs/
Disallow: /
这类“先 Disallow: / 再局部 Allow”的写法要格外小心。不同解析器会按路径匹配规则判断优先级,建议上线前用测试工具和真实日志双重验证。

robots.txt 之外还要检查 WAF 和日志
DeepSeekBot UA 写对后,下一步是看请求有没有被服务器链路放行。AI 爬虫抓取失败,很多时候发生在 CDN、WAF、Nginx、反向代理或安全插件层。
建议按这个顺序排查:
- 打开
https://你的域名/robots.txt,确认线上版本已更新。 - 在访问日志中搜索
DeepSeekBot、deepseek、相关大小写变体。 - 查看状态码:200 代表可访问,403 多为拦截,429 多为限速,5xx 多为服务端错误。
- 对比路径:确认被抓页面是不是你希望开放的页面。
- 检查 WAF 规则:不要用“未知 Bot 一律拦截”覆盖 robots.txt 放行意图。
- 复测 AI 回答:观察品牌是否被提及、排序是否变化、引用来源是否出现官网或内容页。
如果你遇到“robots.txt 已放行但 AI 抓取仍 403”,可沿着AI 爬虫访问被拦截的排查路径逐层定位;涉及 Cloudflare 时,也可参考Cloudflare Bot Fight Mode 放行的最小修复方案。
从“允许抓取”到“被 AI 引用”还差什么
允许 DeepSeekBot 抓取,只是 AI 可见性的入口,不等于品牌一定会被推荐。AI 系统还会看内容是否可解析、信息是否一致、是否有可信来源支撑,以及同类品牌中谁更符合用户问题。
更可执行的做法是建立三张表:
- 问题表:用户会问哪些选型、对比、价格、替代方案、教程类问题。
- 页面表:每个问题对应官网、博客、文档、案例或 FAQ 哪个 URL。
- 引用表:AI 回答里实际引用了哪些域名、页面和句子。
MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,可监测品牌提及率、推荐位次、情绪评价与引用来源。对于 SaaS 与工具类品牌,更建议把 UA 配置和 AI 搜索监测放在同一个复盘周期里看,而不是只改一次 robots.txt 就结束。
MaxAEO 也支持用户注册后获取免费的品牌 AI 可见性诊断报告,用于查看品牌在 AI 平台中的提及率、排名与核心结论。需要做竞品维度复盘时,可以结合ai 搜索竞品监测方法建立长期指标。
上线前检查清单
DeepSeekBot User-agent 写法上线前,按“策略、语法、链路、结果”四层检查。只要其中一层没有验证,就可能出现规则正确但效果错误。
- 策略层:确认是放行、屏蔽、局部开放,还是限速。
- 语法层:
User-agent、Allow、Disallow是否属于同一规则组。 - 路径层:后台、账户、订单、搜索、参数页是否被正确限制。
- 缓存层:CDN 是否返回最新版 robots.txt。
- WAF 层:安全策略是否误拦目标 UA。
- 日志层:是否能看到目标 UA、路径、状态码和访问频率。
- AI 层:是否复测 DeepSeek 等平台的回答提及与引用来源变化。

常见问题
DeepSeekBot User-agent 怎么写才最稳妥?
最稳妥的基础写法是 User-agent: DeepSeekBot,再根据目标写 Allow: / 或 Disallow: /。不要把完整浏览器 UA、版本号或注释混进匹配令牌里。
写了 Allow: / 就一定会被 DeepSeek 引用吗?
不一定。Allow: / 只表示允许合规爬虫抓取,不保证内容会进入索引、训练数据或回答引用。是否被引用还取决于页面质量、信息结构、信源权威性和用户问题匹配度。
可以只靠 robots.txt 屏蔽 DeepSeekBot 吗?
不建议只靠 robots.txt。robots.txt 是协议声明,不是强制访问控制。涉及敏感数据时,应使用登录权限、服务端鉴权、WAF、IP 策略和响应状态码共同控制。
是否需要同时写 DeepSeekBot 和 deepseekbot?
通常优先写标准形式 DeepSeekBot。如果你的日志里长期出现小写或变体 UA,可以增加独立规则组作为兼容,但不要用过宽的 DeepSeek 规则误伤其他请求。
配置后多久能看到 AI 搜索变化?
没有固定时间。UA 放行只能解决访问入口问题,AI 回答变化还受抓取频率、模型更新、引用源更新和问题采样影响。更可靠的方式是每天用同一组问题复测提及率、排序和引用来源。
