← 返回全部文章

工程文档智能解析:先恢复结构,再谈知识抽取

面对扫描件、PDF、Excel 与 Word,可靠的解析不是一次 OCR,而是一条能保留证据的结构恢复链路。

文档智能OCR工程数字化

工程资料的难点不在于“把字读出来”,而在于把信息放回正确的位置。一张设备数据表里,“设计压力”“操作压力”“材质”等字段即使都被识别出来,若无法判断它们属于哪一行、哪一列、哪个设备位号,后续问答、校验和交付都会失去依据。

先定义解析产物

一份可用于业务的解析结果至少应包含四层:原始文件与页码、版面元素及坐标、表格单元格与跨行跨列关系、字段和值的业务语义。前两层保证可回看和可纠错,后两层才能支撑检索和自动抽取。只保存纯文本看似简单,但会把表头、单位、备注与数值之间的关系全部抹平。

表格恢复是一项匹配问题

工程表格常有无线框、多级表头、合并单元格和扫描噪声。一个更稳妥的流程是:先用版面模型识别表格区域与单元格,再从 PDF 文本层或 OCR 获取文字及坐标,最后按包含关系、中心点距离和阅读顺序把文字分配给单元格。对分配置信度低的单元格保留候选项,并输出可视化叠加图,避免把错误静默写入数据库。

通用表格识别测试样例:复杂表格的单元格边界与文字需要共同恢复

图:文档智能解析中的通用表格测试样例。公开文章只使用不含项目数据的样例图,不展示客户资料、位号和完整工程图。

用模板解决重复,而不是掩盖差异

同类数据表往往结构接近,但修订版、不同供应商和 Excel 转 PDF 后都可能出现微小变化。模板应描述“字段可能出现的位置、别名、单位与校验规则”,而不是死记坐标。系统先做版式分类,再将字段规则投射到具体文件;未命中的字段进入人工标注闭环,逐步扩展模板库。

让模型做它擅长的部分

OCR、几何关系和正则表达式适合确定性任务;大模型适合处理字段别名、备注解释和异常归因。把所有内容直接丢给模型,会同时损失定位能力、可重复性和成本控制。更合理的边界是:规则先给出带页码和坐标的候选证据,模型只在有限上下文中完成语义判断,并以 JSON 返回结果。

工程文档智能化的第一原则是可追溯。每一个字段都应能回答三个问题:来自哪份文件的哪一页、原文是什么、为何被映射到这个业务属性。能回答这三个问题,解析结果才真正进入生产环节。