作者:maxaeo.cn|发布日期:2026-08-28|更新日期:2026-08-28
DeepSeekBot robots.txt 配置的核心不是“全站放开”,而是让 AI 能访问可被引用的公开内容,同时继续拦住后台、账户、站内搜索、参数页和接口路径。 对 SaaS 官网来说,正确配置能减少 AI 搜索抓取失败,也能为后续 GEO/AEO 优化打好基础。

什么是 DeepSeekBot robots.txt 配置?
DeepSeekBot robots.txt 配置是指在网站根目录的 /robots.txt 中,用 User-agent、Allow、Disallow 等规则表达 DeepSeek 类爬虫可访问哪些路径、不可访问哪些路径。
需要先说明一个现实问题:截至 2026 年 8 月 28 日,DeepSeek 官方公开入口主要集中在产品、App、API 与研究页面,并未像部分海外 AI 爬虫那样提供稳定、集中、可核验的爬虫 User-Agent 说明页。DeepSeek 官网可见入口以其官方产品与 API 页面为主。因此,站长不应只依赖一个传闻中的 UA 名称,而应采用“显式放行 + 通用规则 + 日志验证”的组合策略。
robots.txt 本身也不是防火墙。根据 RFC 9309 Robots Exclusion Protocol,它是一套爬虫访问声明协议,依赖爬虫遵守;真正的访问控制仍应交给登录权限、WAF、服务器规则和鉴权系统。
推荐模板:允许 DeepSeek 抓取公开官网内容
如果目标是让 DeepSeek 更容易理解官网、产品页、解决方案页和文档页,可使用“公开内容放行、风险路径拦截”的保守模板。它比简单 Allow: / 更适合 SaaS 官网。
# DeepSeek 类 AI 爬虫:显式放行公开内容
User-agent: DeepSeekBot
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /checkout/
Disallow: /search
Disallow: /api/
Disallow: /*?*
Disallow: /private/
# 其他爬虫的基础规则
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /checkout/
Disallow: /search
Disallow: /api/
Disallow: /*?*
Disallow: /private/
Sitemap: https://www.example.com/sitemap.xml
这份 DeepSeekBot robots.txt 配置适合多数 B2B、SaaS、工具型官网。公开页面被允许,后台、个人账户、交易流程、接口和参数页被限制。若你的官网有帮助中心、博客、案例库,建议保持可抓取,因为这些页面往往更容易成为 AI 回答的引用信源。
SaaS 官网哪些页面应该放行,哪些应该拦截?
放行对象应是“希望 AI 正确复述并引用的页面”;拦截对象应是“无公共价值、可能泄露信息或造成重复抓取的页面”。判断标准不是页面数量,而是页面是否能增强品牌实体理解。
| URL 类型 | 建议 | 原因 |
|---|---|---|
| 首页、产品页、价格说明页 | 放行 | 帮助 AI 理解品牌、功能、适用人群 |
| 解决方案、行业页、客户案例 | 放行 | 常被用于“推荐某类工具”问题的证据 |
| 博客、白皮书、帮助文档 | 放行 | 提供定义、教程、对比、FAQ 等可引用内容 |
/admin/、/login/、/account/ |
拦截 | 后台与账户路径无公开搜索价值 |
/api/、内部 JSON、调试路径 |
拦截 | 防止接口被无意义抓取 |
| 站内搜索、筛选参数页 | 通常拦截 | 避免低质量组合页和抓取浪费 |
如果站点近期出现 AI 爬虫访问失败,可按 AI 搜索引擎抓取失败排查指南 从 robots.txt、状态码、WAF 和页面渲染四层检查,不要只改一行规则就结束。
配置时最容易犯的 5 个错误
DeepSeekBot robots.txt 配置最常见的问题,是站长以为“写了允许”就一定能被抓取。实际还要看规则匹配、主机、状态码、页面内容和安全策略。
-
只配置了 www,没配置根域名
https://example.com/robots.txt与https://www.example.com/robots.txt是不同主机,规则不自动继承。 -
在
User-agent: *下误写Disallow: /
这会让多数遵守协议的爬虫全站不可抓取。Google 的创建 robots.txt 文档也强调,规则按 user-agent 分组生效。 -
用 robots.txt 保护敏感数据
robots.txt 是公开文件,不能替代权限控制。敏感页面应通过登录、鉴权、服务器拒绝访问处理。 -
拦住了 CSS、JS 或关键渲染资源
对搜索爬虫尤其危险。对 AI 抓取来说,即使不执行 JS,页面主体内容也应在 HTML 中可读。 -
上线后不看日志和 AI 回答变化
robots.txt 是入口,引用结果才是目标。配置后应验证是否被访问、是否被正确引用、是否改善品牌提及。
如何验证 DeepSeek 是否真的能抓到内容?
验证应分三步:先测协议,再查服务器日志,最后看 AI 回答是否发生变化。只看 robots.txt 文件是否存在,不能证明 DeepSeek 已经理解你的官网。
步骤如下:
- 访问
https://你的域名/robots.txt,确认返回 200、文本内容正确、没有被 CDN 改写。 - 用不同主机测试,例如根域名、www、子域名,确认规则一致。
- 检查 Nginx、CDN 或 WAF 日志中是否出现
DeepSeekBot或疑似 AI 抓取请求。 - 抽查 10 个真实用户问题,例如“某行业有哪些好用的 CRM 工具”。
- 在改动前后用同一批问题复测提及率、推荐位次、引用来源与情感表述。
MaxAEO 在 AI 搜索可见性诊断中常用“10 个真实问题 × 9 个国产 AI 平台”的基线复测思路。这个方法的价值在于:它不把一次回答当结论,而是观察同一口径下的提及率、排序、引用信源和情感变化。若需要进一步拆解 DeepSeek 与其他国产 AI 的访问特征,可参考国产 AI 爬虫 UA 识别、放行与 WAF 白名单配置。

robots.txt、WAF 与 llms.txt 应如何配合?
robots.txt 负责表达抓取意愿,WAF 负责执行访问边界,llms.txt 负责给大模型更清晰的网站内容导航。三者不是互相替代,而是分层协作。
推荐做法是:
- robots.txt:允许公开内容,拦截后台、接口、参数页。
- WAF/CDN:对异常高频、伪造 UA、访问敏感路径的请求限速或阻断。
- llms.txt:整理品牌介绍、产品页、文档、价格说明、案例、FAQ 等高价值链接。
- 站点地图:保持 sitemap 更新,让重要页面可发现。
- 页面结构:用清晰标题、定义段、表格、FAQ 和结构化数据帮助 AI 摘录。
如果你已经遇到 WAF 误伤,可先看 AI 爬虫访问被拦截的排查方法;如果准备补充 LLM 友好入口,可使用 llms.txt 模板与配置指南。
一套更稳妥的 GEO/AEO 基础设施清单
DeepSeekBot robots.txt 配置只是 GEO/AEO 的入口层。真正影响 AI 是否推荐品牌的,是“可抓取、可理解、可信源、可复测”的整套基础设施。
建议按这个顺序建设:
- 抓取层:robots.txt、sitemap、状态码、WAF 放行策略。
- 理解层:首页一句话定位、产品功能、适用对象、价格口径、FAQ。
- 证据层:案例、文档、对比页、媒体报道、第三方目录、行业内容。
- 引用层:让核心页面具备可直接摘录的定义、表格和步骤。
- 监测层:持续观察 AI 平台中的提及率、排序、情绪与引用来源。
MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,可监测品牌提及率、排序、情绪评价与引用来源,并支持引用溯源和竞品对标。对 SaaS 与工具类品牌来说,robots.txt 配置完成后,更关键的是持续确认 AI 是否真的引用了你的官网内容。
常见问题
DeepSeekBot 一定会遵守 robots.txt 吗?
不一定。robots.txt 是协议声明,不是强制访问控制。合规爬虫通常会遵守,但站点仍应通过 WAF、鉴权和服务器规则保护敏感资源。
直接写 User-agent: DeepSeekBot Allow: / 可以吗?
可以作为显式放行,但不建议只写这一组。更稳妥的方式是同时保留 User-agent: * 的基础安全规则,避免未知或未公开 UA 的 AI 抓取路径失控。
配置后多久能在 DeepSeek 回答中看到变化?
没有固定时间。AI 回答受抓取频率、索引更新、引用信源竞争和问题表达影响。建议用同一批问题按天或按周复测,而不是凭一次问答判断成败。
robots.txt 能让 AI 不训练我的内容吗?
不能保证。它只能表达抓取偏好,不能控制模型训练链路。若涉及版权、授权或商业内容保护,应结合服务条款、访问控制和法律策略。
为什么允许抓取后仍然没有被 AI 推荐?
原因可能是页面内容不够明确、缺少权威信源、品牌实体不一致、竞品证据更强,或页面被 WAF/JS 渲染问题影响。此时应同时检查抓取、内容结构和引用来源。
