把一份双栏排版的学术论文 PDF 丢给光学字符识别(OCR)工具提取文字,复制出来的段落前后颠倒——左栏的后半段接上了右栏的前半段,原本完整的句子被拦腰截断。做过文档处理的人对这一幕大概不陌生。它常被当成"排版乱了"的小问题,但在检索增强生成(RAG)系统里,字都认对了、先后关系错了,也可能导致大模型无法准确理解原文语义。
物理坐标扫描为什么会打乱语义?
大多数传统 OCR 引擎处理文档的方式,遵循一个朴素的规则:按物理坐标"从左到右、从上到下"逐行扫描。这个规则在面对单栏排版的普通文档时基本够用,但一旦遇到双栏、三栏的学术论文、研报、检测报告,问题往往就暴露了。
双栏排版中,左栏的正文和右栏的正文在语义上是并列关系。但部分传统物理坐标扫描会先把左栏从头到尾读完,再跳到右栏开头继续——结果就是左栏的后半段与右栏的前半段被强行拼接,文档原有的信息组织关系可能被破坏。
这种"乱序文本"进入 RAG 系统后,可能引发一系列问题:
分块策略失效:基于固定长度或语义边界的分块,在乱序文本上难以准确切分,关键信息可能被拆分到不同块中。
检索召回偏差:向量检索依赖文本块的语义完整性。一个被错误拼接的段落,其向量表示可能偏离原本的语义方向,增加检索召回偏差的可能性。
大模型答案偏差:当检索到的上下文本身就是"语序错乱"的,模型基于此生成答案时,可能增加信息偏差的概率。
文档解析会影响 RAG 系统后续环节的效果表现。阅读顺序还原,就是这个环节中需要关注的一个关键点。
结构理解包含哪几层?
阅读顺序只是其中一层。面向知识库的结构还原,通常需要同时处理以下四类关系:
栏区关系:多栏版面的阅读路径,以及跨栏表格、大图应该插入文本流的哪个位置。
层级关系:标题与正文的从属关系,决定文档能否还原为一棵可检索的章节树,而非平铺的文本序列。
跨页连续性:跨页段落与跨页表格能否合并为一个信息单元,表头能否延续到后续页面。
元素关联:表格与其标题、注释之间,图表与正文说明之间的引用关系。
对企业知识库而言,解析不只是把单页内容取出来,而是要让这四类关系在进入检索环节之前尽可能保持完整。
例如,一份年报中的财务附表可能跨三页,表头在第一页,数据在后续页面延续;一篇论文的图表与正文说明之间存在引用关系;一份技术规范中的条款与附录表格相互印证。这些关联如果在解析阶段丢失,进入知识库后可能形成上下文关联不足的信息片段。
合合信息旗下 TextIn xParse 按上述四类关系组织解析流程。系统首先对文档页面进行版面分析,自动识别并划定栏区边界,据此重建更符合人工阅读逻辑的内容顺序;对于宽度超过单栏边界的跨栏表格、大图等元素,通过版面分析识别其边界并按阅读顺序插入正确位置,避免干扰栏内文本流。
在此基础上,系统融合视觉特征与语义信息判断文本片段的标题层级,构建文档树结构;基于坐标追踪与版面语义分析检测跨页表格与跨页段落,将分属两页的内容合并为完整信息单元;表格部分支持合并单元格、无框线表格、多层表头的结构化输出,并在提取数值的同时保留表格与正文注释、标题、图表的关联信息。
最终输出的 Markdown 或 JSON 中,在版面清晰的文档上,段落顺序通常与人工阅读一致,标题层级与表格行列关系能够得到较好保留,便于后续的分块、检索和生成环节在语义完整的信息单元上工作。
在实际业务场景中,这种能力会影响企业知识库的可用性。例如在制造、金融、能源等行业,大量技术手册、合同附件、检测报告采用复杂版式。如果解析阶段丢失章节关系或表格结构,员工通过知识库查询时可能无法获得完整上下文。
普通 OCR 和知识库解析差别在哪?
对于正在评估文档处理方案的企业,理解"普通 OCR"和"面向知识库的文档解析"之间的区别,是选型的关键前提。
处理目标不同:普通 OCR 的核心目标是字符识别准确率,追求"把字认对"。面向知识库的文档解析需要在此基础上还原文档的语义结构——包括阅读顺序、标题层级、表格行列关系、跨页内容的连续性。
输出形态不同:普通 OCR 通常输出纯文本或带坐标的字符序列。知识库所需的解析结果需要保留结构化的语义单元(如章节、段落、列表项、表格对象),并输出 Markdown 或 JSON 等大模型友好的格式。
错误代价不同:普通 OCR 中一个字符识别错误,影响的是单个词。文档解析中一个阅读顺序或表格结构还原错误,通常影响的是整段上下文质量,进而影响检索和生成效果。
这种差异决定了:企业在搭建知识库或 RAG 应用时,不能简单套用传统文档数字化的技术路径。
怎么在自有文档上验证?
建议取几份业务里版式复杂的文档,解析后可按以下三步看输出:
双栏文档只读输出文本:看句子是否在栏区切换处断开、左右栏内容是否交替串行。栏区切换处的截断可以通过对照原文辨认。
跨页表格看两页接缝:是否合并为一张表、表头是否延续到后页、行列是否错位,无框线表格能否保留行列对应关系。
长文档看章节树:标题层级是否被完整保留,还是被平铺为同一级标题。层级丢失时,条款和章节的定位会明显变难。
此外,输出格式还支持 Markdown、JSON 等可直接对接 RAG 流程的形态。
合合信息旗下 TextIn xParse 基于自研的多模态文本智能技术,支持对跨页表格、合并单元格、密集表格、手写字符及公式等复杂文档元素进行解析。以此为基础,合合信息还提供智能文档抽取、合合信息文档比对、合合信息 INTSIG DocFlow 文档自动化平台等产品,覆盖从识别、解析、抽取到审核的文档全链路处理流程。
在性能方面,xParse 处理 100 页长文档最快约 1.5 秒,离线批量处理下 3 天可完成 500 万页 PDF 的解析。xParse 支持公有云 API、私有化部署等多种集成方式。
点击下方图片,了解合合信息 TextIn xParse 在知识库建设场景中的应用方式。
.png)




