Kimi 爬虫 UA:识别、robots 配置与日志验证指南

Kimi 爬虫 UA:识别、robots 配置与日志验证指南

作者:maxaeo.cn|发布日期:2026-08-29|更新日期:2026-08-29

Kimi 爬虫 UA 指 Kimi 访问网站时在 User-Agent 中声明的爬虫标识。站长真正要区分的不是“要不要封 Kimi”,而是 KimiBot、Kimi-User、Kimi-SearchBot 分别在做什么,以及封掉后会影响训练、实时取回还是 AI 搜索曝光。

Kimi 爬虫 UA 与 robots 配置关系示意图

Kimi 爬虫 UA 目前有哪些?

Kimi 官方公开的主要爬虫标识包括 KimiBot、Kimi-User、Kimi-SearchBot。三者用途不同,应分开写 robots.txt,不建议用一条规则同时封禁。

根据 Kimi Crawlers 官方说明,三类 UA 的含义如下:

UA 标识 官方用途 对网站曝光的影响 建议动作
KimiBot 抓取可能用于基础模型训练的内容 影响模型长期“知道不知道你” 可按目录放行或限制
Kimi-User 用户在 Kimi 中触发的网页读取、总结、检索 影响用户当次能否让 Kimi 读取你的页面 通常建议放行
Kimi-SearchBot 支撑 Kimi 搜索能力,分析页面相关性并建立搜索索引 影响站点是否进入 Kimi 搜索结果 建议放行核心内容

完整 UA 字符串通常类似:

Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; KimiBot/1.0; +https://www.kimi.com/policies/kimi-crawlers

robots.txt 中不必写完整浏览器串,写产品标识即可,例如 User-agent: KimiBot

KimiBot、Kimi-User、Kimi-SearchBot 有什么区别?

三者的核心区别是“训练、用户触发、搜索索引”。如果把它们当成同一种 AI 爬虫处理,最常见后果是误封检索入口,导致品牌在 Kimi 回答里更难被看见。

可以用一个简单判断框架:

  1. KimiBot:长期记忆层
    它更接近训练抓取。你如果担心价格、促销、过期参数被长期写进模型语料,可以对这些路径做限制。

  2. Kimi-User:当次取回层
    它通常由用户动作触发,例如用户让 Kimi 总结某个页面。封掉它,受影响的往往不是“训练语料”,而是正在尝试访问你内容的真实用户。

  3. Kimi-SearchBot:搜索索引层
    它关系到 Kimi 搜索能力能否发现你的页面。对品牌官网、产品页、文档、案例和博客,通常应保持可抓取。

这也是 AI 搜索优化和传统 SEO 不同的地方:AI 回答不只看网页能否被搜索引擎收录,还看大模型在生成答案时能否访问、引用、理解你的内容。若要系统梳理不同国产平台的 UA,可参考 MaxAEO 的国产 AI 爬虫 UA 大全

robots.txt 应该怎么写?

Kimi 爬虫 UA 的配置原则是:放行品牌核心内容,限制高风险和低价值路径,不用 robots.txt 保护真正敏感数据。robots 是声明式协议,不是访问控制系统。

开放型 SaaS、工具站、文档站可使用以下模板:

User-agent: KimiBot
Allow: /blog/
Allow: /docs/
Allow: /product/
Disallow: /search
Disallow: /account
Disallow: /checkout

User-agent: Kimi-User
Allow: /
Disallow: /account
Disallow: /checkout

User-agent: Kimi-SearchBot
Allow: /
Disallow: /search
Disallow: /*?sort=
Disallow: /account

Sitemap: https://example.com/sitemap.xml

如果你只想限制训练用途,而不想损失 AI 搜索曝光,可以更保守地处理:

User-agent: KimiBot
Allow: /blog/
Allow: /docs/
Allow: /case/
Disallow: /pricing/
Disallow: /promo/
Disallow: /private/

User-agent: Kimi-User
Allow: /

User-agent: Kimi-SearchBot
Allow: /

这里的关键不是“封不封”,而是按目录分层。产品介绍、帮助文档、FAQ、客户案例通常应该放行;站内搜索页、筛选参数页、登录后台、购物车、结算页应限制;合同、用户数据、未公开报价不应依赖 robots,而应做服务端鉴权。

关于 robots 的基础规则,RFC 9309 已将 Robots Exclusion Protocol 标准化,其中明确了 user-agent、allow、disallow 等匹配逻辑。实际配置时,最稳妥的做法是少用花哨语法,多用清晰目录规则。

怎样判断访问日志里是不是真的 Kimi?

只看 UA 字符串不够,因为 User-Agent 可以被伪造。可靠判断应采用“三步核验”:先匹配 UA,再核对来源 IP,最后结合路径、频率和状态码判断行为是否合理。

一套可复用的日志排查方法如下:

  1. 按 UA 初筛
    在 Nginx、CDN 或 WAF 日志中搜索 KimiBotKimi-UserKimi-SearchBot

  2. 核对来源 IP
    Kimi 官方页面提供对应 IP range JSON。若访问 IP 落在官方范围内,可信度更高;若不在范围内,只能说明它“自称是 Kimi”。

  3. 看访问路径
    Kimi-User 更可能访问用户粘贴或搜索到的具体页面;Kimi-SearchBot 更可能集中在可索引内容;异常扫描 /wp-admin/、大量参数页、随机路径的请求要谨慎。

  4. 看状态码和频率
    大量 403 可能代表 WAF 误拦;大量 5xx 说明抓取触发了服务压力;高频访问低价值路径时,应优先限速或封路径,而不是封整个 UA。

原创判断框架:建议把日志事件分成四类——可信 Kimi、疑似 Kimi、伪装 Kimi、无关爬虫。只有“可信 Kimi”适合纳入 AI 可见性复盘;“疑似 Kimi”可观察;“伪装 Kimi”应交给 WAF 处理。

Kimi 爬虫 UA 日志验证四分类表

放行 Kimi 会提升品牌 AI 可见性吗?

放行本身不保证被推荐,但会减少“可访问性障碍”。品牌是否出现在 Kimi 回答里,还取决于页面权威性、内容结构、第三方信源、实体一致性和用户问题意图。

对 SaaS 品牌来说,建议优先放行这几类页面:

  • 产品功能页:让 AI 能准确复述你解决什么问题;
  • 文档与帮助中心:让 AI 能引用具体用法;
  • 定价说明页:若价格稳定,可放行;若频繁变动,应写清更新时间;
  • 对比页与案例页:帮助 AI 在选型问题中理解差异;
  • FAQ:适合承接“怎么选、是否支持、和谁对比”类问题。

如果你发现 Kimi 明明能访问官网,却仍然不提到品牌,问题可能不在 UA,而在“信源结构”。可以用 MaxAEO 的AI 搜索竞品监测方法对比提及率、推荐位次和引用来源,判断竞品是因为官网内容更清晰,还是因为第三方页面更容易被 AI 引用。

常见误区:不要把 UA 清单当成万能开关

Kimi 爬虫 UA 只是 AI 可见性治理的入口,不是全部。很多站点配置失败,不是因为不知道 UA,而是把训练抓取、实时检索、搜索索引混在一起处理。

常见误区有三类:

  • 一刀切封禁所有 AI UA:短期减少抓取,长期可能降低品牌在 AI 搜索中的可见性。
  • 只写 robots,不看日志:规则是否生效必须回到访问日志验证。
  • 封掉静态资源目录:如果页面依赖 JS 渲染,误封 /assets//_next//static/ 可能让 AI 读不到正文。

如果站点出现 403、WAF 拦截或 AI 平台无法读取页面,可参考 MaxAEO 的AI 爬虫访问被拦截排查指南大模型抓取 403 原因分析逐层定位。

7 天最小验证法:配置后如何复盘?

Kimi 爬虫 UA 配置后,建议用 7 天做一次最小闭环:先确认抓取是否恢复,再观察 AI 回答是否能引用正确页面,最后决定是否继续放宽或收紧。

可按这张表执行:

日期 检查项 合格信号
第 1 天 robots.txt 可访问 https://你的域名/robots.txt 返回 200
第 2 天 日志出现 Kimi UA 至少能看到对应 UA 或官方 IP 请求
第 3 天 核心页面非 403 产品页、文档页、博客页返回 200
第 4–5 天 低价值路径受控 搜索页、后台页、参数页不被大量抓取
第 6 天 AI 问答抽测 Kimi 能读取或概括目标页面
第 7 天 提及与引用复盘 品牌名、产品描述、引用 URL 是否准确

MaxAEO 国内版覆盖 Kimi、DeepSeek、腾讯元宝、豆包、通义千问、文心一言等 9 个中国大陆 AI 平台,可用于监测品牌提及率、排序、情绪评价与引用来源。若需要建立基线,可通过 MaxAEO 官网获取免费 AI 可见性诊断。

常见问题

Kimi 爬虫 UA 需要全部放行吗?

不一定。对品牌官网、文档、博客、案例等希望被 AI 复述的内容,建议放行;对后台、站内搜索、结算、无限筛选参数等低价值路径,建议限制。

robots.txt 里写完整 UA 字符串还是写 KimiBot?

通常写 User-agent: KimiBotUser-agent: Kimi-UserUser-agent: Kimi-SearchBot 即可。完整字符串适合日志识别,不适合在 robots 中照抄。

封掉 KimiBot 会不会让 Kimi 完全看不到网站?

不一定。KimiBot 主要与训练抓取相关;Kimi-User 和 Kimi-SearchBot 仍可能影响实时取回与搜索索引。若三者都封,品牌在 Kimi 中被发现的机会会明显下降。

Kimi-User 为什么不建议随便封?

因为它常与用户主动访问有关。用户让 Kimi 总结你的文章、读取你的文档或检查你的页面时,封掉 Kimi-User 会直接影响这次用户体验。

User-Agent 可以作为安全依据吗?

不能。UA 只能说明请求“自称是谁”。安全判断还应结合官方 IP 段、访问路径、请求频率、状态码、反向 DNS 或 WAF 行为分析。

Kimi 爬虫 UA 配置后 7 天复盘流程图