国产大模型爬虫名单:识别、分级与放行策略

国产大模型爬虫名单:识别、分级与放行策略

作者:maxaeo.cn|发布日期:2026-08-30|更新日期:2026-08-30

国产大模型爬虫名单不能只看“网上流传的 UA 字符串”。更稳妥的做法是:把可公开核验、日志高频出现、仅社区传闻的爬虫分层管理,再决定放行、限速或阻断。

国产大模型爬虫名单分级示意图

什么是国产大模型爬虫

国产大模型爬虫是指国内 AI 产品、搜索引擎或模型生态用于发现、抓取、索引网页内容的自动化访问程序。它可能服务于搜索索引、AI 摘要、问答引用、训练语料或实时联网检索。

站长真正需要区分的不是“它是不是 AI 公司”,而是它的访问目的:

  • 搜索索引型:如 Baiduspider、PetalBot,通常与搜索结果和内容发现相关。
  • AI 语料/摘要型:如 Bytespider 等,常被归入生成式 AI 抓取讨论。
  • 产品联网型:来自 AI 助手、浏览器、搜索 App 的实时请求,UA 可能更像普通浏览器。
  • 伪装型:UA 写着某个爬虫名,但 IP、反查、访问节奏都不可信。

如果目标是提升 AI 搜索可见性,不建议一刀切封禁所有爬虫。更好的路径是先识别,再做目录级控制,并配合后续的 AI 引用验证。

国产大模型爬虫名单:按可信度分级

下面这份名单采用“可执行分级”,不是把所有传闻 UA 堆在一起。A 级适合优先监测,B 级适合观察与限速,C 级只建议作为日志线索,不建议直接写入白名单。

分级 常见 User-Agent / 关键词 关联生态 建议动作
A Baiduspider 百度搜索、文心生态相关内容发现 可按目录放行,关注抓取频率
A PetalBot 华为搜索、花瓣搜索相关索引 可放行公开内容,限制低价值路径
A- Bytespider 字节跳动、豆包生态常被关联 建议单独限速与日志监测
B Sogou web spiderSogou 搜狗搜索及其内容索引 视业务地区与流量价值决定
B 360SpiderHaosouSpider 360 搜索、纳米搜索生态可能相关 先观察引用价值,再配置
B YisouSpider 神马搜索、移动搜索生态 移动内容站可重点观察
C DeepSeekBotDeepSeek DeepSeek 相关传闻或日志线索 不建议只凭 UA 放行
C QwenAlibabaBotTongyi 通义千问/阿里生态线索 需结合 IP 与来源页验证
C KimiMoonshot Kimi/月之暗面线索 作为日志检索词,不作强规则
C YuanbaoHunyuanTencentBot 腾讯元宝/混元线索 需复核,不宜盲目封禁或白名单
C ChatGLMZhipuGLM 智谱清言线索 仅作监控关键词
C SparkiFlytek 讯飞星火线索 仅作监控关键词

百度官方帮助中心明确提供了 Baiduspider 的 robots.txt 示例,可作为 A 级依据之一;Google 也在其文档中强调不同爬虫可用不同 user-agent token 管理,这一点适用于制定通用规则,参见 Google Search Central 关于爬虫与 robots 的说明

为什么名单不能直接等于白名单

名单只是识别线索,不是信任凭证。User-Agent 本质上是 HTTP 请求头里的自报字段,任何客户端都可以伪造;真正的放行策略必须叠加 IP、DNS、访问路径、频率和返回码。

一套更安全的判断顺序是:

  1. 先查 UA:在 Nginx、CDN、WAF 日志里检索关键词。
  2. 再看路径:是否访问首页、栏目页、文章页、sitemap,而不是只扫登录、接口、参数页。
  3. 检查频率:是否在短时间内造成 CPU、带宽或数据库压力。
  4. 验证来源:能否通过官方文档、反向 DNS、CDN Bot Directory 或稳定 IP 段佐证。
  5. 看 AI 回声:内容被抓取后,是否真的进入 AI 回答、摘要或引用来源。

MaxAEO 的实践经验是:很多 SaaS 站点误把“可带来 AI 引用的索引爬虫”和“无价值高频抓取”放进同一条拦截规则,结果短期服务器压力下降,长期品牌在 AI 答案中的可见性也下降。相关排查思路可参考 AI 爬虫访问被拦截的排查方法

robots.txt 应该怎么配置

robots.txt 适合表达“允许或不允许抓取哪些路径”,但它不是强制安全边界。对国产 AI 爬虫,建议采用“公开内容放行、低价值路径限制、异常流量交给 WAF”的三层策略。

一个偏稳妥的 SaaS 官网模板如下:

User-agent: Baiduspider
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /api/

User-agent: PetalBot
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /api/

User-agent: Bytespider
Allow: /blog/
Allow: /docs/
Disallow: /admin/
Disallow: /login/
Disallow: /api/

User-agent: *
Disallow: /admin/
Disallow: /login/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

这里的关键不是“全部放行”,而是让爬虫更容易抓到可公开传播的页面,例如产品页、案例页、帮助文档、博客和结构化说明页。更完整的 UA 写法可结合 国产 AI 爬虫 UA 识别与 WAF 白名单配置 对照。

robots.txt 中国产 AI 爬虫放行与限制路径示例

WAF 和 Nginx 如何做最小限速

WAF 不应替代 robots.txt。robots.txt 管“礼貌爬虫”,WAF 管“高频、伪装、异常访问”。最小限速策略是:先限频,再挑战,最后才封禁。

Nginx 可用类似思路做基础限速:

map $http_user_agent $ai_bot {
    default 0;
    ~*Baiduspider 1;
    ~*PetalBot 1;
    ~*Bytespider 1;
    ~*Sogou 1;
    ~*360Spider 1;
}

limit_req_zone $binary_remote_addr zone=ai_crawler:10m rate=1r/s;

location / {
    if ($ai_bot) {
        set $limit_key $binary_remote_addr;
    }
    limit_req zone=ai_crawler burst=10 nodelay;
}

这类配置要先在测试环境验证,避免误伤正常搜索引擎、监控工具和付费广告落地页。若已经出现 403、429 或 CDN Bot Fight Mode 误拦,可参考 Cloudflare Bot Fight Mode 放行监控与 AI 爬虫的修复方案

如何判断爬虫是否带来 AI 引用

判断国产大模型爬虫是否有价值,不能只看访问量。更可靠的指标是:抓取后品牌是否被 AI 提到、是否进入推荐排序、AI 回答是否引用自有域名或权威第三方信源。

建议建立一张“抓取—引用—提及”对照表:

指标 观察方式 判断含义
抓取频次 日志中 UA、IP、路径、状态码 是否有稳定发现内容
有效页面占比 文章页/产品页请求占比 是否抓到可被引用内容
返回码 200、304、403、429 是否被误拦或限速过严
AI 提及率 在豆包、Kimi、DeepSeek 等平台测试问题 品牌是否进入回答
引用来源 AI 回答引用的 URL 或站点 自有内容是否成为信源

MaxAEO 国内版覆盖 Kimi、DeepSeek、腾讯元宝、豆包、通义千问、文心一言等 9 个中国大陆 AI 平台,可监测品牌提及率、排序、情绪评价与引用来源。若要把日志识别和答案表现连起来,可使用 MaxAEO AI 搜索可见性监测平台 做持续跟踪。

一手排查框架:三张表比一份名单更有用

单独收藏国产大模型爬虫名单,只能解决“认得出”。真正能指导决策的,是三张运营表:UA 分级表、路径价值表、AI 回声表。

1. UA 分级表
记录 UA、首次出现日期、日均请求、主要路径、状态码、可信度、处理动作。A 级放行,B 级限速,C 级观察。

2. 路径价值表
把网站路径分为高价值、低价值和敏感路径。

  • 高价值:/blog//docs//case//pricing/
  • 低价值:标签页、站内搜索页、重复筛选页
  • 敏感路径:后台、登录、接口、用户数据页

3. AI 回声表
每周固定 10–20 个真实用户问题,在目标 AI 平台复测品牌是否被提到、排第几、引用了哪个 URL。MaxAEO 的 DeepSeek 爬虫抓取协议配置指南 也强调:协议配置后要回到 AI 回答里验证,而不是只看日志。

这套框架的独特价值在于,它把“爬虫治理”从安全团队的拦截动作,变成增长团队可复盘的 AI 搜索资产管理。

常见问题

国产大模型爬虫都应该放行吗?

不应该。公开内容目录可以放行或限速,后台、登录、API、参数页应限制。对来源不明、频率异常、只扫敏感路径的访问,应交给 WAF 或服务器规则处理。

只屏蔽 Bytespider 会影响豆包收录吗?

目前很难用单一 UA 直接证明某个 AI 产品的全部引用来源。更稳妥的做法是:单独记录 Bytespider 抓取变化,再用同一批问题复测豆包等平台的品牌提及和引用来源。

DeepSeekBot、Kimi、Qwen 这些 UA 能直接写 robots.txt 吗?

可以作为观察项写入,但不建议当作强信任规则。很多这类 UA 缺少稳定公开文档,优先级应低于 Baiduspider、PetalBot、Bytespider 等更常见标识。

robots.txt 能阻止所有 AI 抓取吗?

不能。robots.txt 是协议约定,不是访问控制。真正需要保护的数据应通过登录鉴权、权限校验、WAF、接口签名和缓存策略处理。

如何知道自己的网站有没有被 AI 引用?

做法是固定问题、固定平台、固定周期复测,并记录 AI 原文、排名、情绪和引用 URL。MaxAEO 支持保留 AI 原始回答,并按平台和时间维度追踪趋势,适合把结果做成长期看板。