生僻字与方言字:方志数字化的“拦路虎”

做方志数字化的人,几乎都会遇到同一个头疼问题:字打不出来。屏幕上显示一个方框,或者干脆是问号——这个人命地名里的字,不在通用字库里。对普通档案来说这只是个别现象,对方志来说却是系统性问题:人名、地名、物产名、方言词里到处都是。生僻字处理不好,前面 OCR 做得再准也白费,因为字显示不出来、也搜不到。这篇文章讲清楚:生僻字为什么这么多、技术上怎么产生的、有哪几种解决办法、以及项目里该怎么约定验收。
一、问题长什么样:方框、问号与错字
先描述现象,好判断自己是不是踩到了这个坑。
现象一,显示成空白方框。 打开文本或网页,某个字的位置是一个空心方框。这说明系统有这个字的编码,但当前字体里没有这个字形,渲染不出来。
现象二,显示成问号或乱码。 这通常发生在编码转换环节——数据在某个环节丢了字符,变成了替代符号。比方框更糟,因为原始信息已经损坏,不可逆。
现象三,被替换成形近字。 有的处理流程为了“能显示”,把生僻字替换成常见的形近字。表面上没有方框了,实际上内容已经错了——人名被改了、地名被改了,后续所有引用都会跟着错。这是最危险的一种。
现象四,能显示但搜不到。 字显示正常,但用户输入这个字检索时搜不到对应条目。原因可能是输入法打不出这个字,或者检索系统对该字的处理有问题。
这四种现象,在方志项目里都可能大规模出现,而不是偶发。
二、为什么方志里生僻字特别多
方志是生僻字的重灾区,原因有四条。
第一,人名地名用字本身就生僻。 古代命名讲究,常用一些现代汉语里极少使用的字;地名更是保留了大量古字、方言字、自造字,这些字往往只在某一地出现。
第二,方言自造字。 南方方言区尤其明显,很多方言词有专门的写法,这些字本来就不在标准字集里,是民间约定俗成的写法。方志记录物产、民俗、方言时,必然大量出现。
第三,异体字与古字。 汉字在历史上产生了大量异体写法,同一个字可能有几种写法。旧志刻本用的是当时的通行写法,很多在现代已经不再使用。
第四,刻本字形差异。 木刻、石印的字形与今天的印刷体不完全一致,有的字只是笔画上的细微差别,但对识别系统来说就是另一个字。
四条叠加,使得方志的生僻字密度远高于普通文献。这也是为什么通用 OCR 引擎在方志上准确率断崖式下降——它们根本没见过这些字。
三、技术上为什么会显示不出来
理解原理,才能选对解决办法。字符要在屏幕上正确显示,需要同时满足三个条件:
第一,有编码。 这个字在字符集标准里有对应的码位。汉字数量庞大,标准字符集被分成基本区和多个扩展区。基本区覆盖常用字,大量生僻字被收录在扩展区里,越生僻的区,支持它的系统和字体越少。
第二,有字形。 即便有编码,字体里也必须有这个字的形状数据。很多常用字体只覆盖基本区,遇到扩展区的字就渲染不出来,显示成方框。
第三,全链路一致。 从采集、识别、存储、传输到最终展示,每一环都要支持这个字。任何一环不支持,都会出问题——比如数据库存对了,但前端字体不支持,用户看到的还是方框。
三个条件缺一不可。这也是为什么“换个字体试试”经常解决不了根本问题——如果编码环节就丢了,换字体也没用。
四、四种解决办法与各自的代价
业界常用的处理办法有四种,各有适用场景。
办法一,使用覆盖扩展区的大字库字体。 选用收录字数多的字体,并配合支持扩展区的字库。优点是标准做法、兼容性最好;缺点是大字库字体体积大,且并非所有终端都装有该字体,网页端需要考虑字体加载方案。
办法二,造字与字形描述。 对确实无编码的字,用造字方式补充字形,或用字形描述语言记录其结构。优点是能覆盖最生僻的情况;缺点是造出的字在外部系统里无法通用,交换和共享时仍会出问题,且需要维护造字表。
办法三,图片替代。 把该字切成小图嵌入文本。优点是显示一定没问题;缺点是无法检索、无法复制、无法参与文本分析,等于给文本开了个洞。只适合极少数实在无法处理的字,不能作为常规方案。
办法四,规范化与注音标注。 对异体字,在保证不丢失原字形的前提下做规范化映射,同时保留原字形的记录;对生僻字加注音和释义。优点是兼顾了可用性和学术性;缺点是需要专业人员判断,工作量不小。
实务中通常是组合使用:大字库字体解决大部分,造字解决少数,规范化处理异体字,图片替代作为最后手段。
五、为什么这件事必须单独列一道工序
很多项目把生僻字处理当成 OCR 的附属工作,结果出问题。它必须单独成工序,理由有三:
第一,它决定成果能不能用。 字显示不出来或搜不到,用户就无法检索,前面所有的扫描、OCR、校对投入都失去意义。
第二,它需要专门的人员和工具。 判断哪些字需要造、哪些是异体字需要映射,需要懂文字学或熟悉本地地名人名的人参与,不是普通标注员能做的。
第三,它的工作量可预估但不可忽略。 一部县志里需要特殊处理的字可能有几百到上千个,按字计价的话,这笔成本必须提前算进预算,而不是做到一半才发现超支。
建议在方案里明确:生僻字的处理方式、判定标准、验收方法、以及是否单独计价。
六、验收怎么查
生僻字处理好不好,验收时有具体可查的方法:
查显示。 随机抽取含生僻字的页面,在目标系统(网页、阅读器、数据库前端)里打开,确认没有方框、没有问号、没有乱码。
查检索。 把生僻字复制到检索框,确认能搜到对应条目。这是最容易被忽略、也最影响使用的一项。
查准确。 抽查若干含生僻字的人名地名,与原件比对,确认没有被形近字替换。这一项特别重要——替换成错字比显示方框危害更大,因为方框一眼能看出问题,错字却会一直错下去。
查清单。 要求服务商提供生僻字处理清单:共处理多少个字、采用什么方式、造字表或映射表在哪里。这份清单是后续维护的依据,也是成果归档的一部分。
七、生僻字处理与前后环节的关系
生僻字处理不是孤立工序,它与前后环节紧密关联。
与 OCR 的关系:识别引擎要支持扩展字符集,否则识别阶段就把字认错或认不出来,后续处理无从谈起。选型时要实测引擎对生僻字的识别能力。
与校对的关系:校对人员要能判断某个字是否是异体字、是否应该规范化,这需要一定的文字学基础,普通校对难以胜任。建议由专人负责这一环节。
与检索的关系:检索系统要能正确处理这些字的输入和匹配。如果用户输入法打不出这个字,就要考虑提供拼音检索、部首检索等替代入口。
与交换共享的关系:造字在本地系统能用,但与其他单位交换数据时对方无法识别。涉及跨馆共享的,应优先采用标准字符集内的字,造字仅作为本地补充。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于2001年,专注数字资源加工、档案数字化、数据标注、知识图谱构建、试题入库等一站式数据服务二十余年。持有ISO 9001 / 14001 / 45001 / 27001 / 20000-1五体系认证、8项自主软件著作权、企业信用AAA等级,加工场所独立封闭、全程监控,采用三重质检机制(自检→互检→抽检),正确率高于99.99%。
如果您的单位有方志、古籍数字化及生僻字处理需求,欢迎联系获取免费方案:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
