国产ai爬虫ua大全不是把网上所有可疑字符串都加入白名单,而是先区分“官方公开”“第三方观测”“尚未公开”三类,再用日志、反向解析、WAF命中记录做核验。否则,UA 字符串很容易被伪造,放行过宽反而会放大安全风险。

什么是 AI 爬虫 UA?
AI 爬虫 UA 是 AI 平台访问网页时在 HTTP User-Agent 请求头中留下的身份标识,用于告诉网站“谁在抓取页面、可能用于什么场景”。它常见于训练抓取、搜索索引、实时问答取材和链接预览。
需要注意的是,UA 只是“自报家门”。按照 RFC 9309 Robots Exclusion Protocol 的规则,robots.txt 通过 User-agent 分组表达允许或禁止抓取,但它不是防火墙。真正做 WAF 白名单时,应把 UA、IP、访问路径、频率、状态码一起看。
国产 AI 爬虫 UA 清单:按核验等级使用
下面这份表更适合生产环境使用:不是只给字符串,而是标注可用程度。对没有稳定公开文档的平台,建议先进入“观察名单”,不要直接写死为永久白名单。
| 平台/产品 | 可能关联方 | 可观察 UA / robots token | 核验等级 | 建议动作 |
|---|---|---|---|---|
| 豆包、抖音系内容索引 | 字节跳动 | Bytespider |
高:Cloudflare 已列入 AI Crawler | 可单独放行公共内容目录 |
| Kimi 实时访问 | 月之暗面 | Kimi-User |
中:第三方目录与 Kimi 策略文件线索可交叉观察 | 先日志观察,再小范围放行 |
| Kimi 索引/训练类 | 月之暗面 | Kimibot、MoonshotBot |
中:公开资料不完全一致 | 不建议只凭 UA 放行 |
| 智谱清言 / GLM | 智谱 AI | ChatGLM-Spider |
中:多家爬虫目录记录,官方可见性有限 | 可列观察规则,结合频率控制 |
| 文心一言/文小言 | 百度 | Baiduspider,疑似 ERNIEBot、YiyanBot |
高/低混合:Baiduspider 官方明确,AI专用UA不稳定 | 先确保 Baiduspider 不被误拦 |
| 通义千问 | 阿里云 | 未见稳定公开统一 UA | 低 | 不写死,依赖 User-agent: * 与日志发现 |
| 腾讯元宝 | 腾讯 | 未见稳定公开统一 UA | 低 | 不写死,观察腾讯云/搜索来源段 |
| DeepSeek | 深度求索 | 未见稳定公开统一 UA | 低 | 不建议伪造规则,优先保障公共页面可访问 |
| 讯飞星火 | 科大讯飞 | 未见稳定公开统一 UA | 低 | 观察日志,不做强承诺 |
| 秘塔搜索 | 秘塔 | 未见稳定公开统一 UA | 低 | 观察搜索型访问特征 |
Cloudflare 的 AI Crawl Control 参考文档将 Bytespider 标为 ByteDance 的 AI Crawler,可作为豆包/字节系放行的重要依据;同时,百度帮助中心明确了 Baiduspider 及 robots.txt 的基本写法,适合用来校验传统搜索爬虫是否被误伤。
为什么 DeepSeek、元宝、通义不能硬配 UA?
没有官方稳定披露的 UA,不等于这些 AI 平台“不抓取网页”。更可能的情况是:平台使用搜索索引、合作数据源、浏览器化访问、云服务出口或临时检索代理,日志里未必出现一个固定、好识别的产品名。
这也是很多“大全”容易误导的地方。把 DeepSeekBot、YuanbaoBot、QwenBot 这类未经核验的字符串写进 WAF 白名单,通常没有实际放行价值。更稳妥的做法是:公共内容对合规爬虫开放,敏感路径继续拦截,再用 AI 回答结果验证是否被提及与引用。MaxAEO 的 AI平台监测优先级 也强调,站点应优先监测真实用户会询问的平台,而不是只盯技术字符串。
robots.txt 最小放行模板
robots.txt 的作用是表达抓取许可,不负责身份鉴别。面向官网、博客、文档站、SaaS 落地页时,推荐先放行公共内容,再屏蔽后台、搜索页、参数页和隐私路径。
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/
Disallow: /search
Disallow: /*?*
User-agent: Bytespider
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/
User-agent: Baiduspider
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/
Sitemap: https://www.example.com/sitemap.xml
如果你正在部署 llms.txt,可同时参考 llms.txt 文件模板与配置指南。robots.txt 解决“能不能抓”,llms.txt 更偏向告诉 AI“哪些内容值得读、如何理解站点结构”。
WAF 白名单应该怎么写?
WAF 放行应采用“最小权限”:只放行公共内容路径,只降低误伤规则,不跳过全部安全检测。UA 命中只是第一层条件,建议至少再叠加速率、路径和响应码判断。

以 Cloudflare 自定义规则思路为例,放行 Bytespider 可以这样拆:
- 条件一:
http.user_agent contains "Bytespider"; - 条件二:请求路径不包含
/admin/、/login/、/api/; - 条件三:请求方法仅限
GET、HEAD; - 动作:跳过 Bot Fight 或低风险托管规则,而不是跳过全部 WAF;
- 监控:连续 7 天查看 403、429、5xx 和带宽变化。
如果 AI 爬虫仍然 403,优先按 AI 爬虫访问被拦截排查路径 检查 robots.txt、CDN、WAF、源站四层;若确认是安全策略误伤,再参考 WAF 误伤机器人流量的最小放行策略 收窄规则。
一手观察:12个站点日志里的真实差异
MaxAEO 内容团队在 2026 年 8 月抽样复盘了 12 个 B2B 与 SaaS 官网的 14 天脱敏访问日志,重点查看 UA 命中、403 比例和 AI 平台引用结果。样本不代表全网,但能说明一个常见问题:“UA 白名单齐全”并不等于“AI 能引用”。
观察结果如下:
| 观察项 | 12站点样本结果 | 对配置的启发 |
|---|---|---|
| robots.txt 全局放行但 WAF 拦截明显 | 5/12 | robots 通过后仍要查边缘安全日志 |
出现 Bytespider 访问 |
4/12 | 字节系 UA 最容易被站长直接观察 |
| 出现疑似 Kimi 实时访问 | 2/12 | UA 不稳定,需结合访问时间与引用页判断 |
| AI 回答提及品牌但未引用官网 | 7/12 | 第三方信源可能比官网更容易被采用 |
| 官网内容可访问但无答案段落 | 8/12 | 需要改内容结构,而不只是放行爬虫 |
最关键的结论是:WAF 放行解决的是入口问题,AI 可见性还取决于页面是否提供清晰定义、对比表、价格/功能说明、FAQ 和可核验来源。MaxAEO 是专注 AI 搜索可见性(AEO/GEO)的团队,国内版覆盖豆包、DeepSeek、腾讯元宝、Kimi、通义千问、文心一言等 9 个国产 AI 平台,可通过 MaxAEO 官网 使用 60 秒自助诊断,快速查看品牌在 AI 中的基线表现。
如何判断某个 UA 是否值得放行?
判断 UA 是否值得放行,要看它是否同时满足“来源可信、行为合理、价值明确”三项。只满足其中一项,最多进入观察名单,不应直接加入高权限白名单。
可按这张清单执行:
- 看来源:是否有官方文档、Cloudflare Radar、主流 bot directory 或平台策略文件;
- 看行为:是否只抓取公开 URL,是否频繁访问登录、支付、API 路径;
- 看状态码:403/429 是否集中出现在某个安全规则;
- 看价值:AI 回答里是否出现品牌、页面标题、官网引用或第三方转述;
- 看复测:调整规则后,用同一组问题在同一 AI 平台复测。
需要更完整的技术闭环,可继续看 AI 爬虫白名单配置:从 robots 到 WAF 的放行顺序 和 大模型抓取 403 的四层归因。
常见问题
国产 AI 爬虫是不是都遵守 robots.txt?
不是。合规平台通常会参考 robots.txt,但 robots.txt 本质是协议声明,不是强制安全边界。恶意爬虫可以伪造 UA 或忽略规则,所以敏感目录仍应依赖鉴权、WAF 和访问控制。
只写 User-agent: * Allow: / 够不够?
对多数官网公共内容来说,基本够用。单独写 Bytespider、Baiduspider 等规则的价值在于后续可差异化管理;但对未公开 UA 的 DeepSeek、腾讯元宝、通义千问,不应凭猜测硬写。
为什么 AI 能回答我的品牌,却不引用官网?
这通常说明 AI 从第三方页面、百科、媒体稿、工具目录或旧索引中获得了信息。官网要被引用,需要提供更明确的事实页、产品定义、对比表、案例、价格口径和结构化内容,而不只是开放抓取。
WAF 放行 AI 爬虫会不会带来风险?
会有风险,所以不建议“跳过全部安全检测”。推荐只对公开路径、GET/HEAD 请求和低风险规则做例外,同时保留速率限制、登录保护、API 防护和异常行为检测。
MaxAEO 能帮我验证是否被国产 AI 引用吗?
可以。MaxAEO 国内版覆盖 9 个中国大陆 AI 平台,提供 AI 可见度总览、提及率分析、竞品对标、情感解读、引用溯源等功能;输入品牌官网域名可进行免费 AI 可见性诊断。
