“大模型+地方志”:地方已经开始了

大模型火了以后,很多地方志机构都在问同一个问题:能不能让大模型直接读我们的志书,回答群众的问题?答案是——能,但有个前提:大模型只能基于你已经结构化、已经文本化的数据来答,不能直接读懂一堆扫描件。近两年广东、浙江、贵州、上海等地已经陆续启动“大模型+地方志”类项目,路径各不相同,但底层逻辑一致:先把志书变成机器能读的文本和数据,再让模型在这个基础上作答。这篇文章讲清楚这条路怎么走、卡点在哪、地方志机构现在该准备什么。
一、先泼一盆冷水:大模型读不懂扫描件
不少单位的第一想法是:把志书扫描件丢给大模型,让它自己读。现实是行不通的。
第一,扫描件是图像,不是文本。通用模型对影印古籍、竖排繁体、刻本字形的识别能力非常有限,直接读图的结果往往错误百出。
第二,即便识别出来,质量也不达标。旧志里的异体字、避讳字、生僻字,通用引擎大面积失效,而方志恰恰是这些内容最集中的地方。错字连篇的文本喂给模型,得到的答案自然不可信。
第三,没有结构就没有关联。志书里同一个人物可能散见在人物志、职官志、艺文志、选举志多个门类,要让模型把这些串起来回答“某人在本地任过什么职”,靠的是结构化数据和实体关联,不是模型临场发挥。
所以业内的共识是:大模型是上层应用,数据底座才是地基。地基不牢,上层做得再漂亮也会出问题——最常见的表现就是“幻觉”:模型编造一个本地根本不存在的人物或事件,而且说得言之凿凿。
二、地方已经开始了:四条公开路径
近两年,多地已经启动相关实践,路径大致有四类,值得对照参考。
广东:明确提出“大模型+地方志”。 广东省出台地方志数字能力提升相关实施方案,提出以大模型技术赋能地方志的路径。这类提法通常包含智能问答、辅助编修、内容生成等方向,前提是先把志鉴数据整合进统一平台。
浙江:构建智慧应用体系。 浙江发布加快推进新时代地方志事业发展的意见,构建“浙里有志”类智慧应用。省级统筹的好处是标准统一、数据集中,避免了各市县各建一套的碎片化问题。
贵州:方志云已落地知识图谱应用。 贵州依托大数据和云计算技术,实现对地方志数据的深度检索与知识图谱应用。知识图谱在这里的作用是给检索加上关系维度——不只是找词语,而是找实体之间的关联。
上海:区级数字方志馆计划推出智能问答。 上海静安区推出的数字方志文库,通过高标准数字化加工实现全库精准检索,并计划在后续规划中推出知识图谱与智能问答功能。区级层面的尝试说明这条路不只是省级的事。
这四条路径的共同点是:都先做了扎实的数字化和数据整合,再谈智能化。没有一个是跳过了数据底座直接上模型的。
三、要上大模型,数据得先到什么程度
如果单位准备启动这类项目,数据需要分三步准备到位。
第一步,全文文本化。 把扫描件转成可检索的文本,且准确率要够。这一步对旧志最难,需要专业的 OCR 加人工校对,而且必须处理生僻字——生僻字如果显示成方框,后续所有检索都会失效。
第二步,结构化。 把人物、地名、职官、事件、物产等要素抽出来,形成字段化的条目。这一步决定后续能不能做统计、做关联、做图谱。结构化程度越高,智能应用的天花板越高。
第三步,实体对齐与关系构建。 把不同卷、不同志书中的同一实体合并(同名人物、异名地点),并建立实体间的关系——谁任职于哪里、什么事件发生在什么时间什么地方。这一步就是知识图谱的建设,也是四类路径中贵州、上海明确在做的事。
三步走完,数据才真正具备支撑智能问答的能力。跳过任何一步,上层应用都会在某个环节露馅。
四、智能问答能回答什么,不能回答什么
把预期说清楚很重要,避免项目验收时产生落差。
能答好的:事实型查询(某地历史上出过哪些名人、某年发生过什么灾异、某物产的记载沿革)、条目级检索(某人物条目全文)、统计型问题(某时期水灾次数)。这些答案在数据里有明确出处,模型只需准确检索并组织语言。
能辅助但需要人工复核的:跨条目归纳(某地的商贸发展脉络)、古今地名对照、人物关系推断。这类问题需要模型做一定的综合,答案可能有多种表述,需要专业人员把关。
不该让模型独立回答的:涉及评价、定性、争议性历史问题的内容;数据里没有记载的内容。对后者,正确做法是让模型明确回答“未检索到相关记载”,而不是自由发挥。守住“查不到就说查不到”这条线,是避免幻觉最有效的一招。
五、卡点在哪:三个真问题
卡点一,旧志文本化成本高。 繁体竖排、异体字、夹注,让 OCR 准确率上不去,人工校对工时长。这是预算和时间的主要消耗项,也是必须提前实测的部分。
卡点二,标准不统一。 各地数据格式和标准不一致,资源共享不足,是公开资料中被反复指出的问题。建议在项目启动时就明确 XML 结构与字段字典,最好参照上级平台的规范,避免做完再改。
卡点三,持续运营缺人。 平台上线不是终点,年鉴逐年入库、新数据补录、错误修正都需要持续投入。很多项目的问题不是建不起来,而是建完之后没人维护,慢慢变成死库。
六、给准备启动的机构的建议
第一,从高频问题反推,不要贪大。 统计群众和研究者最常问的一两百个问题,反推需要哪些实体、哪些字段、哪些关系,先把这部分做深做透。小而准的图谱,远比大而粗的图谱有用。
第二,把“查不到就说明查不到”写进设计。 让系统在没有依据时明确提示,比编一段更专业,也更符合地方志工作的严谨性要求。
第三,选对数据加工伙伴。 大模型应用的上限取决于数据质量,而数据质量取决于 OCR、校对、结构化、实体抽取这些具体环节。北京海天雷鹰从事数字资源加工与知识图谱构建二十余年,可提供从志书扫描、OCR 与人工校对、生僻字处理、XML 结构化到实体关系抽取的全流程数据服务,配合三重质检机制,为大模型与知识图谱应用提供可靠的数据底座。
“大模型+地方志”不是让模型替你读志书,而是让已经数字化的志书被更多人说得出、查得到。地方已经开始了,但先动手的都做对了一件事——先把数据地基打牢。
七、成本与周期:智能化项目到底要花多少
这类项目的成本集中在数据侧,而不是模型侧。大致可以拆成三块:一是文本化成本,包括扫描、OCR 和人工校对,旧志占比越高成本越高;二是结构化成本,包括字段体系设计、实体抽取、人工复核,抽取字段越多成本越高;三是平台与集成成本,包括系统开发、接口对接、部署和运维。
周期上,数据准备通常占整个项目工期的一半以上。很多单位预期“几个月上线”,实际卡在数据加工上。建议做两件事:一是先做小范围试点,选一两卷走完全流程,用实测数据推算总量;二是在预算里为“补充加工”留余量,因为几乎每个项目都会在中途发现新的数据问题。
另外一个容易被忽略的长期成本是数据更新。模型上线后,新志出版、年鉴入库、错误修正都需要持续投入数据侧人力。把这部分写进年度预算,智能化应用才不会在上线一年后因数据陈旧而被弃用。
八、一个容易忽略的前提:标准要先行
多地实践反复暴露出一个问题——数据格式和标准不统一,资源共享不足。这对智能化是致命的:同一人物在不同县志里字段名不同、同一地名的写法不同,模型就无法正确关联。
因此建议在项目启动阶段就把标准定下来:字段字典怎么定、实体怎么命名、年代和地名怎么规范化、XML 结构参照什么规范。标准先行,后期整合和共享才有基础;标准后置,做完了再改的代价极高。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注、EPUB电子书等方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
