首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >PDF 喂进知识库前,先过文档解析:被“粉碎”的版式,才是建库失败的真因

PDF 喂进知识库前,先过文档解析:被“粉碎”的版式,才是建库失败的真因

原创
作者头像
克劳德2048
发布于 2026-09-24 12:00:00
发布于 2026-09-24 12:00:00
1700
举报

摘要:

线性文本化会把 PDF 压成一段字符,标题层级、表格列名与数值、多栏顺序这些关系全部丢失,下游分块与检索随之失准。多模态解析(文档版)用阅读顺序、层级结构与图片资源保留这些关系,输出可直接入库的结构化结果。

一、PDF 里的版式是怎么被“粉碎”的

把一份 PDF 交给一个“能读文字”的工具,它给出的结果往往看起来是对的——文字都在,顺序大致也对。问题在于,PDF 面向的是“人眼阅读时看到的那一版”,而文本抽取面向的是“把字符按一定顺序排出来”。这两者不是一回事:阅读时,标题的字号、段落的缩进、表格的边框、图片的位置,都在参与表达含义;一旦被压平成一段线性文字,这些参与表达的结构全部退出,只剩下一串字符。

这就是“粉碎”的含义。它不是把文字丢了,而是把文字之间的关系丢了。而后续的分块、检索、生成这一整条链路,依赖的恰恰是关系,不是字符。

建库之后发现答案不对、检索不准,最先被怀疑的通常是分块策略、检索参数或者模型,这三个环节也确实需要调。但能调好的前提,是解析产物本身还留着结构;结构在这一步就丢了,后面怎么调都补不回来。这也是解析必须放在入库之前的原因。

1.1 标题层级丢失:目录与正文被拉平

一份规范的技术文档、制度文件或合同,靠的是章节层级来组织内容:第几章、第几节、第几条。层级决定了某一段话的适用范围——同样一句“最长不超过 30 天”,出现在“甲方义务”下面和出现在“免责条款”下面,含义完全不同。

线性文本化的结果是所有标题变成普通的一行文字,层级关系消失。入库之后,每一段文字都失去了它所在的“位置”,检索命中某一段时,系统无法判断它属于哪一章,生成答案时也就无法判断这句话管的是什么范围。

1.2 表格被拆散:列名与数值失联

表格是容易在抽取过程中受伤的一类内容。线性文本化会把表格按行或按块转成文字:表头的列名出现一次,后面的数据行只剩下一串数字;如果表格跨页,第二页往往连列名都没有,只留下若干行数值。

数值一旦和列名分开,含义就不可恢复了。“合计金额 12800”这行字本身没错,但它指的是一月的还是一季度的、是含税还是不含税,取决于它原来在表格里的位置。检索到这样的片段,模型只能猜;猜出来的结果读起来通顺,却不一定是文档里写的意思。

1.3 图片与公式变空白

图片、流程图、示意图、公式,在纯文本抽取里通常以两种方式消失:要么被整块跳过,输出里干脆没有这段内容;要么被替换成一小段占位文字。公式的情况更麻烦,很多 PDF 中的公式以矢量图形或特殊字体嵌入,文本抽取拿到的是一串符号乱序的字符。

后果是文档里存在“看不见的空洞”——正文写着“详见图 3”,而图 3 从来没有进入过解析结果;题干里写着“根据公式(2)计算”,公式(2)在库里是一串无法解析的字符。

1.4 多栏阅读顺序错乱

双栏、三栏排版在学术论文、说明书、年报里很常见。按坐标从上到下扫描时,同一水平线上的左右两栏内容会被交错读出,形成“左栏第一段接右栏第一段接左栏第二段”的顺序。拿到这份输出的人只能靠语义猜测去拼回原文;而入库之后,这种错序会直接变成检索块的错序,甚至让相邻两栏的内容被切进同一个分块。

二、“保全版式”具体保全什么

既然问题出在关系被丢掉,那么解析要做的就不是“尽可能多地把字读出来”,而是把关系一并保留下来。落到能力描述上,就是三项:阅读顺序、层级结构、图片资源。

这三项与前面列出的四类伤害并不是一一对应。表格的结构不由某一项单独承担,它与参数选择中的切片表格识别有关;以图形方式嵌入的内容,则由图片资源这一项承接。

2.1 阅读顺序

阅读顺序回答的是“这些内容按什么次序读”。对多栏、横竖混排、图文穿插的文档,正确的阅读顺序等同于还原了一次人的阅读路径:先读完左栏再到右栏,先读正文再到图注。

它的价值在下游的分块环节体现得最直接:顺序正确,分块才能放心按结构边界来切;顺序错乱时,切出来的块从一出生就带着错误的上下文。

2.2 层级结构

层级结构回答的是“这段内容属于哪里”。带层级结构输出,意味着标题与正文的从属关系在解析结果里仍然成立。

有了层级,分块就可以按章节来切,而不是按固定字数来切;检索命中某一段之后,也能顺着层级把父级标题一起带出来,作为判断这段内容适用范围的最小上下文。

2.3 图片资源

图片资源回答的是“那些不能变成文字的内容去哪了”。解析结果不能只有文本流,还必须把文档中的图片单独抽出来保存成文件,让“图 3”这个引用有对应的实物。

图片资源承接的是以图片、图形方式存在的内容。如果业务需要的是公式的结构化表达式,而不是原样保留的图形,那属于另一类能力,选型时要单独确认。

这三件事配合起来,才构成“整份文档的可用表示”:文字有顺序,内容有归属,非文字内容有实体。只做文字识别、不做这三件事的方案,输出的仍然是碎片。

三、解析结果长什么样、怎么入库

文档智能的多模态解析(文档版)用一个接口支持不同格式的文档解析,接口为 MultimodalDocParse。它的定位是助力企业文档智能化及大模型应用前处理环节,也就是把“入库前的这一步”做完整。

结果不是一段文本,而是一个 zip 压缩包。调用后获得结果的临时下载地址(ResultUrl),压缩包内包含 .md 文件、.json 文件以及 images 文件夹三部分:Markdown 便于直接阅读与展示,JSON 承载结构与坐标信息,images 文件夹保存文档中的图片资源。这里有一个容易踩坑的点:这个下载地址的有效期是 30 分钟,集成层应当在拿到地址后立即转存到自己的对象存储,而不是把地址存起来等后续任务再取。

下表是提交解析任务时的主要参数,其中对入库结果影响最直接的是输出形态(ResultType)与任务类型(TaskType)。

参数

取值

说明

FileType

1 PDF / 2 Word / 3 PPT / 4 Excel / 5 Markdown / 6 TXT / 7 图片 / 8 WPS

按实际文件类型指定,默认值 1

ResultType

1 json / 2 markdown / 3 xml / 9 json + markdown + xml

默认值 9,即三种结果一起返回

TaskType

0 文档解析 / 1 图片 OCR 识别 / 2 切片文字识别 / 3 切片表格识别 / 4 切片代码识别

默认值 0 文档解析

PageRange

形如 1-10

指定需要识别的页码范围,单次调用最多 300 页

EnableSubImg

true / false

是否支持子图解析,默认 false

ResultType 的选择取决于下游要什么:入库分块依赖结构,用 json;需要直接把内容展示给人看,用 markdown;默认值 9 一次拿到三种形态,适合使用方式还没定型的阶段。TaskType 则是“按文档主体内容选”——以表格为主体的报表类文档,走切片表格识别能更好地保留表格结构。

入库动作可以按这个顺序组织:按 FileType 和 PageRange 提交解析任务,拿到 zip 后解压,用 JSON 中的层级结构与阅读顺序重建分块,用 Markdown 作为可读文本,用 images 文件夹里的文件补齐正文中被引用的图。

四、规格与成本口径

八类格式通用,差别主要在文件大小与页数上限:PDF、Word、PPT 支持 150M 且 300 页以内,Excel 支持 10M 以内,TXT 支持 10M 以内,图片文件支持 70M 以内;文件下载时间不超过 3 秒,单次调用最多支持 300 页,超过这个页数需要按 PageRange 分批。默认并发数为 5。

计费按页。后付费单价为 0.08 元/页,预付费资源包的阶梯价如下。

资源包规格

价格

折合单价

1000 页

70 元

0.07 元/页

1 万页

600 元

0.06 元/页

10 万页

5000 元

0.05 元/页

100 万页

40000 元

0.04 元/页

免费额度为 1000 页/用户,首次开通服务时一次性发放,有效期 1 年;付费资源包同样是 1 年有效期,采购量要按这一年里真实能用上的页数来定。

并发不够时可以购买并发买断包,价格为 3000 元/并发/月,单次下单最低购买 5 并发,购买页默认最高支持购买 10 并发,超过 10 并发需联系商务,主子账号共享并发任务数额度。按最低档计算,5 并发是 15000 元/月。

这里的并发指同时能接几个任务:5 并发表示同时可处理 5 个已提交的任务,约束的是“同时有几份文档在解析”,而不是单份文档的页数上限。要不要扩容取决于提交方式——集中在月底、季度末这类峰值时段,扩容能明显压缩总耗时;提交分散、对完成时间没有硬要求时,默认的 5 并发足够支撑。

五、总结

入库前这一步决定了后面所有环节能拿到什么。文字被读出来只是及格线,阅读顺序、层级结构与图片资源被一并保留下来,文档才算真的可用。

决定采购之前,先按实际页数把量级估出来,再对照档位定价逐档核算。多模态解析(文档版)首次开通即发放 1000 页免费额度、一年内有效,用免费额度就够把一批真实文档的解析链路先跑通,不必一上来就付费;确认要放量之后,再对照 文档智能特惠活动 的折扣档位:多模态解析(文档版)新用户首单低至 5 折、不限新老用户低至 6 折,按页数选规格更划算。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 摘要:
  • 一、PDF 里的版式是怎么被“粉碎”的
    • 1.1 标题层级丢失:目录与正文被拉平
    • 1.2 表格被拆散:列名与数值失联
    • 1.3 图片与公式变空白
    • 1.4 多栏阅读顺序错乱
  • 二、“保全版式”具体保全什么
    • 2.1 阅读顺序
    • 2.2 层级结构
    • 2.3 图片资源
  • 三、解析结果长什么样、怎么入库
  • 四、规格与成本口径
  • 五、总结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档