档案数字化成果:单层 PDF、双层 PDF、XML 结构化数据区别

档案数字化做完验收时,交付清单上往往写着几种成果形态:单层 PDF、双层 PDF、XML 结构化数据、图像文件。不少单位的负责人拿到手会问:这三种 PDF 到底有什么区别?XML 又是干什么用的?它们不是重复劳动吗?答案是否定的——这三种形态服务的是三种完全不同的利用目的,选择哪一种,取决于你将来要怎么用这批档案。这篇文章把三者的结构、能力、成本和适用场景讲透,帮你判断自己的项目该要哪几种。
一、先搞清楚:为什么要分这几种形态
理解这几种成果的区别,要从档案利用的三种需求说起。
第一种需求是看:我要打开这份档案,像翻原件一样把它读完。这需要保真,版面、印章、批注、哪怕纸上的折痕都最好保留。
第二种需求是查:我要在这批几十万页的档案里,找到提到某个单位、某个时间、某个人的那几页。这需要能被机器检索到。
第三种需求是用:我要把档案里的内容变成可分析的结构——比如把一千份合同里的甲方、金额、签订日期提取出来做统计分析。这需要数据是可计算、可关联的字段。
看、查、用,三种需求对应三种技术形态:单层 PDF 主要服务“看”,双层 PDF 服务“看+查”,XML 结构化数据服务“用”。理解了这层对应关系,后面的选择就有依据了。
二、单层 PDF:最保真,也最“死”
单层 PDF 是把扫描得到的页面图像直接放进 PDF 容器,一页一张图像,清晰度取决于扫描参数。它的优点是极其简单、极其保真:原件什么样,屏幕上就什么样,印章位置、批注字迹、排版位置完全不变,是最接近“数字照片”的档案形态。
它的缺点同样明显:不能被检索。PDF 里没有文字信息,Ctrl+F 搜不到任何东西;不能复制文字;也不支持屏幕朗读,读屏软件读出来一片空白。对于要靠关键词检索的场景,单层 PDF 等于只能靠目录逐卷浏览。
它适合什么场景?按卷浏览、强调原貌的场景:珍贵历史档案、字画、手稿、古籍影像、需要作为证据核验原件的档案。另外,它常作为长期保存的“正本”格式(建议用 PDF/A),因为结构最简单、依赖最少,几十年后依然能打开。
三、双层 PDF:既保真,又能搜
双层 PDF 在单层 PDF 的基础上增加了一层看不见的文字层。技术上是这样的:底层是扫描得到的清晰图像,上层是 OCR 识别出来的文本,按坐标透明地覆盖在原位置上。
这样一来,用户在阅读器里看到的是清晰的原稿,但搜索引擎读到的是下层的文字。按 Ctrl+F 输入关键词,能直接跳到含这个词的页面;鼠标拖选能复制文字;读屏软件也能朗读。“看得真”和“查得到”第一次同时满足。
双层 PDF 的质量取决于两件事:一是扫描清晰度,糊了 OCR 就识别不准;二是 OCR 引擎的能力,中文繁体、竖排、表格、手写,识别难度层层加码。识别出来的文字层必须做质检——如果文字层与图像位置错位,搜到的词会跳错地方,体验反而更糟。
要注意的是,双层 PDF 不等于完美。它也继承了图像层的缺点:全文内容虽然能被检索,但仍不是一个结构化的数据;想做统计分析,光靠它是做不了的。
四、XML 结构化数据:把内容变成可计算的字段
第三种形态是层级的提升——不再是“页面的数字化”,而是“内容的数字化”。XML(可扩展标记语言)用标签把内容组织成树形结构,把字段化的信息明确标记出来。
举个例:一份土地出让合同,用 XML 可以标记出受让方名称、地块编号、出让面积、出让年限、成交价格、签订日期。这些不再是 PDF 里的一行字,而是有明确含义的、可被程序读取的字段。一千份合同都这样处理后,就可以直接做查询、做统计、做关联分析。
XML 的价值在于让档案从“可读”变成“可算”。它支持精确查询,支持跨文档关联,支持导出到业务系统。缺点是:结构化程度越高,加工成本越高——需要人工或高质量的自动抽取来做字段标定,还要处理抽取出错的情况。
所以 XML 结构化数据的典型应用是:需要对大量同类档案做统计分析的业务,比如合同管理、行政审批、不动产登记、司法裁判文书的案件要素提取。
五、三者横向对比
把三种形态放在一起对比:
单层 PDF:优点是保真度最高、加工成本最低、长期保存最稳妥;缺点是不可检索、不可复制、不支持无障碍朗读。适用于作为正本长期保存,或原件珍贵不需全文检索的场景。
双层 PDF:优点是既保真又支持全文检索与复制,支持无障碍;缺点是加工成本中等偏高(多了 OCR 与校对),质量依赖扫描与 OCR 水平,且仍是“页面型”而非“数据型”。适用于绝大多数需要检索利用的文书档案,是目前最主流的交付形态。
XML 结构化数据:优点是字段可计算、支持精确查询与统计分析、便于与业务系统集成;缺点是加工成本最高、需要明确的数据 schema、抽取质量需要严格质检,且不保留版面原貌。适用于需要进入业务系统做分析的同类文档批量处理。
一句话总结:保存用单层,检索用双层,分析用 XML。三者不是替代关系,而是可以按需要组合交付。
六、成本怎么算
三种形态的成本差异明显,大致可以这样理解:单层 PDF 是基准成本,包含扫描与图像处理;双层 PDF 在此基础上增加 OCR 与校对的投入,若涉及繁体竖排或手写,成本还会继续上升;XML 结构化则是把“按页加工”变成“按字段加工”,需要额外的 schema 设计、数据抽取、字段质检,是三者中单位成本最高的。
成本的另一个隐藏项是质检。双层 PDF 要抽检 OCR 准确率与文字层对位;XML 要抽检字段抽取准确率,通常要求关键字段99%以上。质检标准越高,投入越大,但换来的是交付后可放心使用。压掉质检,问题会推迟到使用环节才暴露,那时纠正的代价是前期的数倍。
另外要考虑的是存储与后续维护。三种形态的存储量差异不大(相比原始图像,文本层和 XML 数据量很小),但 XML 需要随业务变化维护 schema 版本,这是长期成本。
七、怎么选:三个问题定方案
面对一个具体项目,用三个问题就能定方案:
第一问:这批档案将来主要怎么用? 只是归档保存以备调阅——单层 PDF(建议 PDF/A)配上完整目录著录就够了;需要全文检索——上双层 PDF;需要统计分析或进业务系统——上 XML 结构化。
第二问:预算和工期允许多少? 预算紧张时可以分层:珍贵档案做双层,普通档案做单层;或者先做单层保真作为正本,后续有预算再补 OCR 加工成双层。分层策略能让有限预算用在最关键的地方。
第三问:有没有系统承接口? 很多单位做了一堆 XML,结果发现业务系统没有对应接口接收这些数据,最后闲置。所以在决定做 XML 之前,一定要先和系统承建方确认数据接口定义,包括字段字典、XML schema 版本、导入方式。先定接口,再定加工,顺序不能反。
八、给采购方的三点提醒
第一,验收要实测,不要只看文件属性。判断双层 PDF 是不是真的双层,打开文件按 Ctrl+F 搜一个已知关键词,确认能准确跳转;文件属性显示有文字层,也不代表对位准确。
第二,明确长期保存格式。推荐 PDF/A(尤其是 PDF/A-1b 或 PDF/A-2b),它禁止外部依赖、要求字体内嵌,能避免多年后出现“字体丢失、版面崩坏”的问题。
第三,成果要分版本交付。建议正本(全保真、长期保存)与利用副本(脱敏、便于对外)分开交付,各自用途写清楚。北京海天雷鹰在档案数字化项目中,会按客户需求分别交付三种成果形态,并提供格式说明与质量抽检报告,确保交付即可用、多年后仍可读。
单层 PDF、双层 PDF、XML 结构化数据,不是三选一的技术路线,而是服务“看、查、用”三种需求的三个层次。想清楚未来怎么用,交付形态的答案自然就出来了。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注、EPUB电子书等方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
