PDF内容 AI能读吗?能读,但只有带文字层的 PDF 能读到大约六成;扫描件和长图接近读不到。 判断只需一步:文字能用鼠标框选复制出来的,AI 大概率读得到;复制不出来的,AI 基本读不到。
这条差距在传统 SEO 报表上完全看不出来——服务器日志显示文件被抓走了,收录正常,但里面的参数、方法、数据从未进入任何一次 AI 回答。
本文给出我们 2026 年 5—7 月的一次跨平台实测:七类非 HTML 载体、128 个页面、1536 轮问答,逐项测能不能被读到、被引用,以及怎么用最低成本改过来。
先给结论:哪些载体读得到,哪些几乎读不到
AI 平台读取网页内容分三步——抓取拿到文件 → 解析提取文字 → 检索时召回并引用。载体不同,断点位置不同:
- 文字层 PDF 卡在第三步:能解析,但排不进召回
- 扫描件、长图、Canvas 卡在第二步:文件拿到了,提不出字
- 跨域 iframe 卡在第一步:压根没进抓取队列
"能不能复制"这条规则对 PDF、长图、Canvas 全部成立。唯一例外是部分平台会对图片型 PDF 跑 OCR,但成功率低到不能当依据用。

我们是怎么测的:指纹事实法与 1536 轮跨平台问答
指纹事实法:在每个载体里挑一个"全网只在这里出现过一次"的字符串作为探针,再去问 AI 这个字符串对应的事实。答对说明它读进了这个载体;答不出或答错,说明这条信息没进它的可用语料。
为什么不用"直接问 AI 有没有读到这个 PDF"?因为模型会基于常识和同站其他页面编出看似合理的答案。指纹事实把"读到了"和"猜对了"分开——探针在全网唯一,猜不出来。
测试口径:
- 样本:128 个页面,来自 42 个站点(客户站与公开站各半),覆盖制造业参数表、金融/教育资料包、设计类官网三种典型场景
- 载体:文字层 PDF、扫描件 PDF、长图详情页、同域 iframe、跨域 iframe、Canvas/SVG、无字幕视频,共七类
- 平台:DeepSeek、豆包、Kimi、通义千问,均开启联网/搜索模式
- 轮次:每个探针在每个平台问 3 轮取多数,合计 1536 轮问答
- 三层记录:服务器日志里是否有对应 UA 的 200 响应(抓取层)→ 探针事实是否答对(解析层)→ 用户真会问的自然问题下是否被命中并给出来源(检索层)
探针举例:某工业连接器型号「XR-7120」的防护等级「IP66」,只出现在一份产品样本 PDF 的第 14 页表格里,官网 HTML 与任何第三方站点均无这条数据。提问即「XR-7120 的防护等级是多少」。
局限说明:这是一次时间切片测试,平台解析能力持续变化,绝对数字会漂移。但各类载体之间的相对差距非常稳定——三个月内复测两次,排序没有变过。所以下表该看的是量级差(61% vs 7% vs 4%),不是小数点。
实测结果:七类非 HTML 载体可读取程度对照表
三层指标定义:抓取可达率=日志里能看到成功响应的比例;指纹命中率=探针事实被正确复述的比例;检索引用率=自然提问下该内容被答案采用的比例。
| 载体类型 | 抓取可达率 | 指纹命中率 | 检索引用率 | 断点位置 |
|---|---|---|---|---|
| HTML 页面(对照组) | 98% | 88% | 63% | — |
| 文字层 PDF(可复制) | 96% | 61% | 34% | 检索层 |
| 同域 iframe(HTML 子页) | 74% | 38% | 19% | 抓取+检索层 |
SVG 内 <text> 文本 |
95% | 22% | 8% | 解析层 |
| 跨域 iframe(第三方嵌入) | 31% | 9% | 3% | 抓取层 |
| 扫描件/图片型 PDF | 94% | 7% | 2% | 解析层 |
| 长图详情页(JPG/PNG) | 97% | 4% | 1% | 解析层 |
| Canvas 渲染文本 | 93% | 0% | 0% | 解析层 |
| 无字幕视频/音频 | — | 3% | 1% | 解析层 |
最刺眼的一行是长图:文件本身 97% 都被抓到了,里面的字只有 4% 被读出来。 服务器日志一片繁忙,实际信息传递接近于零。那 4% 也多半不是 OCR 的功劳——逐条回溯后发现,命中的探针都能在页面标题、面包屑或 alt 文本里找到重复表述。
文字层 PDF:能读,但要连过三道关
文字层 PDF 命中率 61%,是所有非 HTML 载体里最高的,但和 HTML 的 88% 仍差 27 个百分点。丢失集中在三个地方。
一是表格结构塌陷。 多列参数表被解析成一行行乱序文本,型号和数值对不上号——AI 能看到「IP66」也能看到「XR-7120」,就是不敢把两者连起来。我们样本里跨页表格命中率只有 29%,单页表格 68%,差 39 个百分点。跨页拆分是 PDF 里最贵的一个格式选择。
二是 PDF 元数据缺失。 近六成样本的 PDF 标题字段是「Microsoft Word – 未命名文档」或设计软件的默认导出名。Google 在 PDF 文件的搜索最佳实践里说明,PDF 标题取自文档元数据与指向该文件的链接锚文本;AI 平台的取标题逻辑类似——元数据是空的,这份文件在索引里就没有身份。
三是没有入口。 PDF 常常只挂在一个「资料下载」按钮后面,站内没有任何一段文字介绍它讲了什么。抓取器拿到了文件,却没有上下文告诉检索系统"这份文件是回答什么问题的"。想把白皮书做成真正的引用源,技术白皮书成为 AI 引用源需要补齐的版本、作者、方法与数据字段这套写法比单纯优化文件本身更管用。
扫描件与图片型 PDF:接近完全读不到
扫描件 PDF 指纹命中率只有 7%,和长图同一档。 这类文件在字节层面就没有文本流,解析器打开后拿到的是一串图像对象。
Google 在 PDF 文档最佳实践里公开说明它可能对 PDF 内嵌图片跑 OCR,判断标准就是能否把文字复制粘贴到纯文本文档里。国产 AI 平台在联网检索路径上更保守——我们在 22 个扫描件样本上没有观察到任何一次稳定的 OCR 结果,仅有的几次命中都能追溯到同站其他 HTML 页面上的重复表述。
结论直接:把合同模板、认证证书、行业报告直接扫描上传,等于把这部分内容排除在 AI 可见度之外。
长图详情页:AI 眼里的一片空白
长图是电商和设计类官网的重灾区。一张 800×6000 的详情图里可能塞了产品卖点、规格、售后政策、对比表格——在 AI 的语料里,这些全部不存在。
31 个长图样本中,唯一一组命中率明显偏高(19%)的站点,恰好是「长图 + 下方保留一份纯文字规格列表」的双层结构。它们并没有放弃设计,只是多留了一份可读副本。 这是整个测试里成本最低、收益最直接的一个模式。
顺带一提:长图里的价格、库存、活动信息一旦过期,改图的成本远高于改一行 HTML——可读副本还顺手解决了维护问题。
iframe:同域和跨域是两个世界
同域 iframe(子页在自己域名下)命中率 38%,跨域 iframe 只有 9%——差四倍。 原因在抓取层:跨域嵌入的子页往往没有任何内链指向、不在 sitemap 里、有时还被第三方服务的 robots 规则挡住,抓取器根本没有理由去访问它。
Google 为这种场景提供了 indexifembedded 机器人 meta 规则:子页标 noindex 防止它单独出现在结果里,同时加 indexifembedded 允许它作为宿主页的一部分被索引,两者必须同时出现才生效。这是把嵌入内容留在索引里的正规做法,但它解决的是"允不允许",不解决"找不找得到"。
实操建议:能用服务端渲染直接吐进主页面 DOM 的,就别用 iframe。 必须用 iframe 的(第三方计算器、地图、报表看板),在宿主页里另写一段 200 字左右的纯文本摘要,把 iframe 里最关键的结论说出来。
Canvas、SVG 与视频音频
Canvas 命中率是干净的 0%——文字绘制在位图上下文里,DOM 里一个字符都没有。数据大屏、图表库默认的 Canvas 渲染模式全部属于这一类。ECharts、Chart.js 默认走 Canvas,ECharts 可切 renderer: 'svg',改一行配置就能把图表文字从 0% 拉到 22% 那一档。
SVG 稍好,命中 22%,因为 <text> 元素本身是文本节点。但多数设计稿导出会把文字打散成 <path> 曲线,一旦转曲就退化到和 Canvas 同级。判断方法:在浏览器里试试能不能选中图表上的文字。
无字幕视频命中 3%,几乎全部来自标题和页面描述。想让播客、直播回放、课程视频参与 AI 检索,只有一条路——上传文字稿。这类跨载体的可引用性问题,Can AI Search Cite Non-HTML Content? 里的跨格式检索测试有更完整的横向数据可以对照。
读不到的三个环节:抓取、解析、检索各自会在哪断掉
排查非 HTML 内容的 AI 可读性,按抓取 → 解析 → 检索的顺序逐段验证,不能跳步。 每段的症状和修法完全不同,顺序搞反会让人在错误的地方使劲。
抓取层断掉——症状:日志里根本没有对应 UA 的记录。常见原因是 robots.txt 里写了 Disallow: /uploads/ 或 /pdf/(很多 CMS 默认配置就这么干)、WAF 把非主流 UA 当爬虫拦了、CDN 对大文件返回 403。修法在服务器配置层,跟内容无关。
解析层断掉——症状:日志有 200,但探针事实答不出来。这是本文测的主战场,扫描件、长图、Canvas 全部死在这里。修法只有一个方向:生产一份文本形态的等价内容。
检索层断掉——症状:探针事实能答对,但用户自然提问时答案里没有你。说明内容进了语料却排不进召回,通常是缺少问题式标题、缺少自包含的答案段落,或者这份内容在信源栈里的权重太低。文字层 PDF 的 61% 命中率对 34% 引用率,丢的 27 个百分点全在这一层。
一个容易被跳过的判断:先看日志再改内容。 我们遇到过团队花两周把 PDF 全部重做成 HTML,结果 robots.txt 一直屏蔽着 /static/,改造完照样零命中。
改造方案:保留原件 + 增补可读镜像,八步走完
核心是不删不改原件,只在旁边加一份 HTML 可读镜像。 设计稿不用重做,PDF 不用下架,客户签字的正式文件保持原样——增量成本主要是一次内容搬运。
- 盘点载体。用爬虫或 sitemap 导出全站页面,筛出正文字数少于 300 字但页面高度超过 3000px 的页面(长图特征),以及所有
.pdf链接。这一步通常两小时内跑完。 - 给每个载体挑一条指纹事实。选那种"全网只有你这里有"的具体数值或表述,用来做改造前基线和改造后复测。
- 建 HTML 镜像页,URL 放在原件同目录下,如
/download/xr-7120.pdf对应/products/xr-7120-spec。镜像页不是简单粘贴,要把标题层级、段落、列表重新组织成语义 HTML。 - 参数表必须用真
<table>。不要用图片、不要用 div 模拟表格、不要用 Canvas 图表。表头写清单位,跨页表格在 HTML 里合并成一张完整表——这一条直接对应上文 29% vs 68% 的差距。 - 页面开头放 40—60 字的答案先行摘要,直接回答这个页面对应的核心问题。这一块是 AI 最容易整段摘录的位置。
- 双向链接与 canonical。镜像页里用描述性锚文本链到原件(如「下载 XR-7120 完整技术手册 PDF」),原件的 HTML 容器页链回镜像页。canonical 指向镜像页而不是 PDF——可读版才应该是索引的主体。顺带解决 PDF 内链接问题:Google 关于可抓取链接的说明要求链接以标准
<a href>形式出现在 HTML 里,PDF 文件内的链接对抓取器往往不可用。 - 补入口。把镜像页加进 sitemap、加进栏目导航、从相关文章内链过去。抓取器需要至少一条路径才会来。
- 两到四周后复测指纹事实,四个平台各问三轮,和基线对比。
图片型 PDF 还有一个折中做法:用 OCR 工具生成带文字层的版本覆盖原文件,视觉不变但文字可复制。这一步能把 PDF 从 7% 那一档拉回 61% 那一档,成本极低——是整个清单里投入产出比最高的单点动作。
优先级建议:如果只能做一件事,先改承载核心转化的那 10—20 个页面(产品参数、定价、方法论),不要从资料库开始。资料库页面多但单页价值低,改造性价比排在最后。

三个行业的改造前后对比
制造业参数表:命中率 6% → 57%
一家工业连接器厂商,183 个型号的完整参数只存在于三本样本册 PDF 里,官网产品页只有一句话介绍和一张效果图。改造前,「XR-7120 防护等级」这类问题在四个平台的指纹命中率是 6%。
改造动作:把三本样本册拆成 183 个型号页,每页一张真 HTML 参数表 + 一段 50 字规格摘要 + 一个 PDF 下载入口。八周后复测,命中率 57%,检索引用率从 1% 升到 22%。 型号级长尾问题几乎全部从"不知道"变成"有具体数值且带来源"。
值得记的一点:品牌词类问题基本没动,涨的全是型号级长尾。载体改造买的是长尾覆盖,不是品牌声量。
金融资料包:整包 ZIP → 单篇摘要页
一家理财教育机构把 12 份研究资料打包成 ZIP 供下载,AI 侧完全不可见——ZIP 连抓取解析都不会发生。改造动作是为每份资料建一个 800—1200 字的 HTML 摘要页,写清方法、样本、结论和发布时间,原 ZIP 保留。改造后 12 份资料中有 7 份在相关提问中被引用过。
关键细节:这类内容涉及金融,AI 平台的信源筛选明显更严——第一版摘要页只搬了结论,引用率几乎没动;补上机构资质、作者署名和数据口径之后才起来。强监管行业的这层额外门槛,医疗、金融进入 AI 谨慎回答白名单的做法里有更具体的拆解。
设计感官网:整页长图 → 语义 HTML + 图注
一个高端家居品牌的官网,五个核心页面全部是整屏长图 + 少量导航文字,正文字数不足 200。改造没有动视觉:保留全部长图,在每张图下方增加一段图注文字,把图里的材质、工艺、尺寸、产地说出来,并把「关于我们」的品牌故事从图里搬进 HTML。
四周后,品牌在「实木家具 环保等级」这类品类问题里的提及从 0 次变成 3 次/10 轮。视觉一个像素没改,AI 可见度从零到有。 这也解释了为什么很多设计驱动型品牌在 AI 里查无此人——不是品牌弱,是内容压根没进语料。至于进了语料之后 AI 会挑哪些点来夸,品牌叙事错位的诊断与纠偏是下一层问题。
十分钟自查清单
按顺序做完这五步,就能判断自己的核心内容 AI 读不读得到:
- 复制测试:在 PDF 或页面上框选核心参数,尝试复制。复制不出来 = AI 读不到。
- 查看源代码:
Ctrl+U打开源码,搜一个核心参数值。搜不到 = 需要进一步区分是渲染问题还是载体问题。 - 禁用 JavaScript 后刷新:看还剩多少内容。剩一片空白说明依赖客户端渲染,抓取风险高。
- 检查 robots.txt:确认没有屏蔽
/uploads/、/pdf/、/static/这类存放资料文件的目录。 - 直接问四个平台:把指纹事实当问题问 DeepSeek、豆包、Kimi、通义千问各三轮,记录命中次数。这是最接近真实的检验。
五项里有两项不通过,基本可以判定该页面的核心信息处于 AI 不可读状态。 全套跑完约十分钟,不需要任何付费工具。
改完怎么验证真的被读到了
验证要看趋势而不是单次结果,因为同一个问题在同一平台的不同轮次可能给出不同答案。 我们内部的最低验收口径是:每个探针 4 平台 × 3 轮 = 12 次问答,改造后命中 ≥ 6 次才算通过。
三个层次的验证信号,按可靠性从低到高:
- 日志出现抓取记录——只证明文件被拿走了,不证明被读懂
- 指纹事实能被复述——证明内容进了可用语料
- 自然提问下被引用并给出链接——证明内容进了召回,这才是 AI 可见度的真实提升
只靠手动问答很难维持长期监测:轮次一多就统计不过来,平台答案又天天在变。把探针问题做成固定问题集持续跑,才能看出改造效果是稳住了还是掉了;这套监测数据反过来也能变成下一轮的选题依据,把 AI 监测数据变成选题排期的流水线讲的就是这个闭环。MaxAEO 的监测面板可以把这类探针问题排成固定任务,按天记录四个平台的提及、排名与引用来源变化,改造前后的对比直接出图。
常见问题
PDF内容 AI能读吗?扫描件真的一点都读不到吗?
文字层 PDF 能读到相当一部分(实测指纹命中率 61%),扫描件几乎读不到(7%)。区别在于文件里有没有文本流。判断方法是尝试复制文字:能复制说明有文本层,不能复制就是纯图像。扫描件可以用 OCR 工具重新生成带文字层的版本,视觉不变但可读性大幅提升。
把 PDF 转成 HTML 后,原来的 PDF 要删掉吗?
不需要删。推荐「保留原件 + 增补镜像」:PDF 继续提供下载(很多 B 端用户就是要下载存档),HTML 镜像页承担被检索和被引用的职责。canonical 指向 HTML 镜像页,两个页面之间用描述性锚文本互链即可。
长图详情页加了 alt 文本,AI 是不是就能读了?
作用有限。alt 文本一般只有几十个字符,装不下一张长图里的全部信息。实测中它更多是帮助 AI"知道这里有张什么图",而不是"知道图里写了什么"。真正有效的做法是在图片下方补一段结构化的文字说明或参数表,把图里的关键信息用 HTML 重新说一遍。
iframe 嵌入的第三方内容怎么处理?
优先改成服务端渲染直出。确有必要用 iframe 时,两件事同时做:在被嵌入的子页上配置 noindex + indexifembedded(两者必须同时存在才生效),并在宿主页里另写一段纯文本摘要,把 iframe 里的核心结论说出来。跨域 iframe 的实测命中率只有 9%,不要指望它承载关键信息。
密码保护或需要登录才能下载的 PDF 呢?
一律读不到。抓取器拿不到文件,连解析层都进不去。资料需要留资转化的,做法是:把核心结论、方法和一两张关键数据表放在公开的 HTML 摘要页上,完整版报告仍走表单下载。摘要页负责被引用,完整版负责收线索,两者不冲突。
上传到 AI 对话框里的 PDF 和网上的 PDF 是一回事吗?
不是。手动上传走的是文档解析通道,模型直接拿到整份文件,扫描件也常能通过 OCR 读出来;联网检索走的是抓取索引通道,受抓取权限、解析能力、召回排序三重限制。本文所有数据测的都是后者——你自己上传能读出来,不代表用户提问时 AI 找得到。
改造之后多久能看到 AI 侧的变化?
我们样本里的中位数是 3—5 周,快的两周内就能测到指纹事实被复述。影响速度的主要变量是站点抓取频率和新页面的内链密度——从高流量页面链过去的镜像页,通常比只挂在 sitemap 里的快一倍以上。建议改造后第 2、4、8 周各复测一次,用同一套探针问题,才看得出是真的稳住了。
