数字资源加工的常见格式——PDF、EPUB、XML、HTML、MOBI

把一摞纸质书变成数字资源,第一步不是买扫描仪,而是回答一个问题:加工成什么格式? PDF、EPUB、XML、HTML、MOBI——这五个名字在项目方案里经常并列出现,但它们扮演的角色完全不同:有的负责“原样保存”,有的负责“灵活阅读”,有的负责“承接结构”,有的已经“功成身退”。格式选错,后面的加工、分发、再利用全部返工。这篇文章把五种格式一次讲清:各自解决什么问题、适合什么场景、在加工链路里处于什么位置。
一、格式是数字资源加工的第一个决策
数字资源加工不是“把纸变成电子文件”这一个动作,而是一条链路:纸质原件 → 数字化采集 → 格式加工 → 存储管理 → 发布利用。格式决策处在链路的中间,却决定两头:
- 决定采集端怎么做:扫描件的分辨率、色彩模式、是否要保留版式,都随目标格式不同而不同;
- 决定利用端能用什么:能不能检索、能不能重排版、能不能在手机上舒服地读、能不能二次加工成知识库语料,全是格式说了算。
很多项目翻车就翻在这里:花大价钱扫了几十万页,全部转成一种“看起来通用”的格式,结果存档的不符合归档要求、发布的不适配阅读器、想喂给大模型发现没有结构。格式先行,是数字资源加工的第一条纪律。
二、PDF:锁定版式的“纸面替身”
PDF 的核心特征是固定版式:你在哪台设备上打开,它都是同一副样子——文字位置、图片位置、分页方式全部锁死。这让它成为“纸面替身”:合同、公文、论文、画册,凡是“长什么样”和“写了什么”同样重要的东西,都用 PDF。
在加工链路里 PDF 有两个细分角色要分开看:
- 普通 PDF:用于日常分发阅览,体积小、兼容性好,但它只是“电子纸”,文字层可以检索,结构却没有——标题、正文、图表在文件内部并没有严格的逻辑区分;
- PDF/A:归档专用版本(ISO 19005 系列标准),禁止外部依赖、要求自包含、限制有损压缩,专门为“几十年后还能原样打开”设计。档案馆、图书馆的长期保存库通常指定 PDF/A。
一句话:PDF 负责“保真”,不负责“结构”。
三、EPUB:会随屏幕重排的电子书标准
EPUB 和 PDF 的思路正好相反:不锁版式,锁结构。一个 EPUB 文件(本质是一个 ZIP 包)里装的是 XHTML 章节文件、样式表和资源图片,阅读时由阅读器根据屏幕大小实时重排——手机上五寸屏和电脑上二十七寸显示器,看到的是同一本书的两种自适应排版。
这对数字出版意味着什么?一次加工,全终端适配。出版社不需要为不同尺寸的设备各做一版文件。
几个值得记住的事实:
- EPUB 3.3 由 W3C 于 2023 年 5 月发布为正式推荐标准,同时发布的还有配套的阅读系统规范和无障碍规范;
- EPUB 3 已被 ISO 采纳为国际标准(ISO/IEC 23736 系列);
- 2022 年起,亚马逊的 Send to Kindle 服务放弃 MOBI/AZW 转而支持 EPUB,EPUB 事实上成为电子书通用交换格式。
在加工链路里,EPUB 是面向读者交付的终点格式:结构化内容加工完成后打包成 EPUB,进入各阅读平台分发。
四、XML:一切结构化加工的源头
XML 是五种格式里最不“面向读者”的一个,却是数字资源加工真正的技术核心。
XML 用标签描述内容的逻辑结构:这是章、这是节、这是标题、这是正文、这是图注、这是参考文献。一旦内容以 XML 存在,它就不再是“一页一页的样子”,而是“一棵结构树”——同一份 XML 源文件,可以套不同样式分别输出 PDF、EPUB、HTML、网页数据库版本。
这就是出版行业说的“一次加工、多次发布”:核心资产是 XML,PDF、EPUB 都只是它的“渲染结果”。学术出版用的 TEI、图书出版用的 DocBook、期刊常用的 JATS,都是 XML 的行业应用方案。
判断一个加工商专业不专业,看它交付什么:只交 PDF 的,做的是“扫描打印店生意”;能交结构化 XML 的,做的才是数字资源加工。
五、HTML:面向网络的原生载体
HTML 是网页的原生语言,也是 EPUB 内部章节文件的基础。在数字资源加工语境里,它的定位是网络发布的载体:在线文库、机构知识库、教育平台的课件页面,底层都是 HTML。
HTML 的优势是无需专用阅读器、天然联网、可交互:可以嵌入检索、批注、答题、统计脚本,这些是 PDF 和 EPUB 做不到或做不好的。数字教材、题库系统、在线知识库这类“资源要挂进平台跑起来”的场景,最终都以 HTML 形态落地。
它也有代价:HTML 文件依赖平台环境,离开网站就“散架”,不适合作为长期保存的归档格式——所以它和 XML 的关系通常是:XML 存结构,HTML 做呈现。
六、MOBI:正在退场的老兵
MOBI 是亚马逊 Kindle 早期专用格式,曾经统治电子书市场。它的历史地位值得尊重,但现状很明确:官方已弃用。2022 年亚马逊 Send to Kindle 停止接受 MOBI/AZW,转向支持 EPUB;新款 Kindle 设备的系统也不再原生支持老格式的历史邮件推送。
在今天的加工项目里,MOBI 只剩一种角色:存量转换。老书库里有历史批次的 MOBI 文件,需要批量转换为 EPUB 以适配新阅读生态。新加工项目直接产出 MOBI,已经没有意义。
七、五种格式一张表看懂
| 格式 | 版式逻辑 | 结构化程度 | 主要用途 | 在链路中的位置 |
|---|---|---|---|---|
| XML | 无版式(纯结构) | 最高 | 结构化源数据、一次加工多渠道发布 | 加工核心层 |
| PDF / PDF/A | 固定版式 | 低(视觉保真) | 分发阅览、长期归档(PDF/A) | 交付与归档层 |
| EPUB | 自适应重排 | 高(章节树) | 电子书发布、多终端阅读 | 交付层 |
| HTML | 自适应 | 高(配合平台) | 在线平台、互动资源 | 发布层 |
| MOBI | 自适应 | 中 | 历史存量、正被 EPUB 取代 | 淘汰层 |
八、怎么选:按用途倒推格式
格式选择没有标准答案,只有倒推逻辑。问三个问题:
第一问:这份资源未来要干什么? 只是存档备查,选 PDF/A 加原始扫描件;要进阅读市场,选 EPUB;要挂在线平台做检索互动,选 HTML;要沉淀为可反复利用的内容资产,就必须做 XML 结构化加工。
第二问:需要几层交付? 成熟项目普遍是“组合交付”:XML 作源、EPUB 作电子书、PDF 作打印/归档副本,一份内容三种形态,各走各的分发渠道。单选一种格式满足所有需求,是幻想。
第三问:加工预算怎么分配? 格式越结构化,人工投入越大:纯扫描转 PDF 最便宜,OCR 加双层 PDF 居中,深度结构化 XML 最贵。按资源的再利用价值分配预算——只会被看一次的文档别做 XML,要反复改版再利用的核心资产别只做 PDF。
九、总结
五种格式各司其职:PDF 锁版式负责保真与归档,EPUB 锁结构负责多终端阅读,XML 是一次加工多次发布的结构源头,HTML 负责在线平台呈现,MOBI 已完成历史使命正在退场。选格式的正确姿势不是挑一个“最好”的,而是按用途倒推组合:存档归档、阅读分发、平台利用、内容资产,分别对应不同格式,一个项目往往需要多层交付。
一句话总结:数字资源加工中,XML 承载结构、PDF 保真归档、EPUB 适配阅读、HTML 面向平台、MOBI 正在退场——按“存什么、给谁看、怎么用”三个问题倒推格式组合,而不是寻找万能格式。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注、EPUB电子书等方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
