数字资源加工:PDF、EPUB、XML 三种格式对比,哪种适合档案与知识库建设?

某馆 2016 年完成数字化后,把成果统一转成了 EPUB,理由是“手机上能看、能搜索”。五年后要做专题统计时发现两个问题:同一份文件在不同阅读器上页码不同,引注没法写;想统计“某责任者在某时间段内的文件数量”,只能靠人工翻。另一个单位走了相反的路子,只留了 XML,检索统计很顺手,但一次抽取错误导致日期字段批量错位,等发现时原始图像已按合同销毁,无法回溯核对。两次踩坑的根因是同一个:把呈现格式、阅读格式、结构格式当成一回事。本文按档案保存与知识库建设两条需求线,给出 PDF、EPUB、XML 的选型结论。
一、三种格式的本质差异:版式固定、可重排、纯结构
1. PDF 锁的是“看起来的样子”
PDF 的规范由 ISO 32000 定义(PDF 1.7 对应 ISO 32000-1:2008,PDF 2.0 对应 ISO 32000-2:2020)。它的核心是一套页面描述机制:每一页有固定的几何尺寸,文字与图形按确定的坐标与绘制顺序落位,字体可嵌入文件内部。这带来两个后果:
- 呈现一致:同一文件在任何符合规范的阅读器上,版式、分页、字号关系保持稳定。
- 语义靠坐标:PDF 里的文本本质上是“某段字符串画在页面的某个位置”,它不携带“这段字符串是责任者字段的值”这类语义。抽取字段只能靠坐标与版式推断,属于二次加工。
2. EPUB 管的是“读起来的体验”
EPUB 的内容主体是 XHTML 加 CSS,由包文档(OPF)组织阅读顺序,由导航文档(Nav)提供目录。EPUB 3.3 于 2023 年 5 月 25 日由 W3C 发布为推荐标准,支持可重排(reflowable)与固定版式(fixed layout)两种形态。可重排模式下,字号、行距、分页都由阅读器决定:
- 优势:在小屏设备上可读性好,能随屏幕宽度重排,适配无障碍朗读。
- 代价:页码不固定、版式不固定,同一内容在不同设备上呈现不同。对需要“复制件与原件一致”的档案场景,这是根本性缺陷。
3. XML 定的是“内容是什么”
XML 由 W3C 定义(XML 1.0 第五版,2008 年发布),本身不含任何呈现指令,只描述结构与语义。人文学科与图书馆领域已形成成熟标记体系,如 TEI(文本编码倡议)用于文本结构标注,档案与数字图书馆领域常用 METS 描述整体结构与文件清单、ALTO 记录每页 OCR 结果与坐标、PREMIS 记录保存事件与技术元数据。
- 优势:层级天然对应档案的“全宗—案卷—件—页—段”结构;可用 XPath 精确定位节点、用 XQuery 做聚合统计、用 XSLT 转成任意输出;字段是否齐全、枚举是否合法、日期格式是否正确,可用 XSD 或 DTD 定义的 schema 自动校验。
- 代价:没有呈现层,人不能直接阅读,必须配渲染流程;schema 设计需要前置投入;标签带来体积开销。
一句话概括三者分工:PDF 管版式,EPUB 管阅读,XML 管语义。
二、档案保存线:为什么结论是 PDF/A
1. PDF/A 是什么
PDF/A 是 PDF 的归档子集,由 ISO 19005 系列定义:PDF/A-1(2005 年)基于 PDF 1.4,PDF/A-2(2011 年)基于 PDF 1.7,PDF/A-3(2012 年)允许在文件中嵌入任意格式的附件,PDF/A-4(2020 年)基于 PDF 2.0。一致性级别分 b 级(保证视觉可再现)与 u 级(在 b 级基础上保证文本可抽取为 Unicode),另有 a 级(已在新版本中弱化)。
2. 四条硬机制对应四个归档要求
- 自包含:所有字体、图像、色彩定义必须嵌入文件内部,禁止外部字体引用、禁止外部内容流。这正对应 OAIS 参考模型(ISO 14721) 中“表示信息”的要求——信息对象必须携带足以脱离原始软硬件环境被解释的全部材料。
- 版式固定:页面几何与绘制顺序固定,复制件与原件版式一致,可作为凭证链条的一环。
- 禁用动态特性:PDF/A-1 禁止 JavaScript、禁止加密、禁止外部参照,降低“打开后内容可能变化或被锁死”的风险;PDF/A-2 起支持 JPEG 2000 压缩、透明与 OpenType 字体,但对动态内容仍有限制。
- 元数据强制与可校验:XMP 中必须声明 PDF/A 版本与一致性级别,一致性可被工具自动校验,因此能作为入库前的硬性门禁。
3. 落地时的两个注意点
- 压缩方式要匹配版本:PDF/A-1 因历史专利原因不允许 LZW 压缩,允许 Flate(ZIP);PDF/A-2 才允许 JPEG 2000。由无损 TIFF 母版转换 PDF/A 时,必须先确认目标版本允许的压缩编码,否则校验不通过。
- 级别要按需选:仅需保真调阅选 b 级;需要全文检索与文本再利用,必须选 u 级,否则文本层可能无法被可靠抽取。
4. 双层 PDF 的准确定位
双层 PDF 是“图像层 + OCR 文本层”的组合,文本层带坐标,支撑全文模糊检索。它解决的是“能不能检索到这个词”,不解决“能不能按字段算”。文本层里的一串数字,机器并不知道它是文号、日期还是金额。因此双层 PDF 应归入保真层的能力增强,而不是知识层的替代方案。
三、知识库线:为什么只有 XML 级结构化够用
1. 字段检索需要“值加归属”
全文检索做的是字符匹配,回答不了这些问题:责任者为某人的文件有多少份、成文日期落在某个区间的文件清单、某类文号的年度分布。这些问题要求数据具备“字段—值”的确定归属,以及可计算的数据类型(日期可比大小、数值可求和)。纯文本与图像都不具备这两个条件。
2. XML 提供的三项能力
- 精确取值:XPath 直接定位到节点,取到的是确定的字段值,而不是从版式里猜出来的字符串。
- 可校验:schema 把字段完整性、枚举合法性、格式规范性变成可执行检查。这是 PDF 与 EPUB 都不具备的能力——它们只能校验文件能不能打开。
- 可溯源:ALTO 一类格式保留每个字符或词在页面上的坐标,检索结果可反查到具体页面位置,结构化数据与原图之间建立双向链路。抽取有误时可回到原图核对,错误是可发现、可纠正的。
3. 常见替代方案为什么不够
- CSV 或二维表:表达不了“一件档案含多个责任者”“一个案卷含多份文件”这类一对多层级,多值字段只能靠分隔符硬拼,后续必然出现解析分歧。
- 关系库直存:能解决层级,但缺少与图像坐标的关联字段,检索结果无法回跳原页,且保真层仍然要靠另一套文件体系维护。
- JSON:结构与 XML 等价,同样可用;差别在于校验生态(XSD、Schematron 在文献与档案领域成熟)与行业既有规范(METS、ALTO、TEI 均为 XML 体系)。选型的现实依据是标准生态,不是语法优劣。
4. 代价要提前算清
XML 方案需要前置投入三件事:schema 设计(字段清单、层级、枚举)、转换流程(从 OCR 结果或双层 PDF 提取并映射)、渲染流程(XSLT 转 HTML 或转 PDF)。这三件事不做完,XML 就只是一堆带尖括号的文本,不会自动产生价值。
四、组合策略:PDF/A 保真加 XML 做知识层
1. 四层结构
1. 母版层:无损 TIFF 或 JPEG 2000 无损,按件型确定分辨率与色彩模式,只进不出,作为一切再加工的源头。
2. 保真层:由母版生成 PDF/A(建议 2u 或 3b 及以上),承担归档保存、凭证调阅、全文检索三项职责。
3. 结构层:由 OCR 与抽取流程生成 XML,携带字段、实体关系与页面坐标引用,承担检索、统计、图谱构建职责。
4. 服务层:由 XML 生成网页版、EPUB 阅读版与接口数据,不承担保存职责,可随时重建。
2. 两份文件怎么关联
靠唯一标识符:以件号加页号为主键,配合内容哈希。XML 的每个字段节点记录来源页号与坐标,PDF/A 的每页通过页码与之对应,实现“检索结果一键跳原页”。若采用 PDF/A-3,还可将 XML 原件作为附件嵌入同一 PDF/A 文件,实现单文件交付的双层结构——保真版与结构化版在同一载体中互为校验。
3. 与 OAIS 的对应关系
按 OAIS 的术语:母版与 PDF/A 构成归档信息包(AIP)中的保真副本,XML 是内容层的结构化表示,EPUB 与网页版属于分发信息包(DIP),由 AIP 按需生成、可随时重建。这个对应关系明确了重建优先级:服务层丢了可以重生成,保真层与母版丢了不可恢复。
五、选型决策表与常见错误案例
1. 按需求勾选的决策表
| 需求 | 推荐格式 | 判断依据 |
|---|---|---|
| 长期保存与凭证效力 | PDF/A(2b 或更高) | 自包含、版式固定、一致性可校验 |
| 全文模糊检索 | 双层 PDF/A(u 级) | 文本层带坐标,可抽取 Unicode |
| 字段检索、统计、计算 | XML(配 XSD) | 值有归属、类型可计算、schema 可校验 |
| 移动端阅读、无障碍朗读 | EPUB 3 | 可重排、结构语义标签完善 |
| 单文件同时交付保真版与结构版 | PDF/A-3 | 允许嵌入 XML 等任意附件 |
| 网页发布与接口服务 | 由 XML 生成的 HTML 或 JSON | 服务层可重建,不作为保存格式 |
| 跨机构长期交换 | PDF/A 加 XML 双轨 | 分别承担保真与语义职责 |
2. 六个常见错误选型
- 用 EPUB 做档案归档:字体不保证嵌入、分页随设备变化、无法证明与原件版式一致,凭证链条在第一步就断了。
- 把纯图像 PDF 当知识库:没有文本层,检索只能走目录字段;扫描质量一旦不佳,内容彻底不可达。
- 用办公文档格式做长期保存:这类格式结构随软件版本演进、呈现依赖特定软件、字体与对象常外部引用,不满足自包含与版式固定两项要求。
- 只做 XML 不留保真层:抽取出错时无法回溯核对,错误既不可发现也不可纠正,是这类方案最致命的风险。
- PDF/A 转换失败强行降级:未嵌入字体、透明图层、音视频、表单与脚本在早期 PDF/A 版本中不受支持,必须在转换前用预检工具处理源文件,而不是转换失败后降低级别了事。
- XML 不配 schema:字段随意增删、日期格式各行其是,机器无法校验,最终退化成带尖括号的纯文本,与直接存 TXT 没有区别。
六、总结
一句话总结:档案保存线选 PDF/A,靠自包含与版式固定保证凭证;知识库线选 XML,靠 schema 与层级支撑字段检索与统计;正确做法不是三选一,而是 PDF/A 保真加 XML 做知识层的双轨组合。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注、EPUB电子书等方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
