知识图谱的前世今生:从语义网到 GraphRAG

“知识图谱”这个词是 2012 年 Google 提出来的,但它的思想源头可以再往前追半个世纪。从学术实验室里的语义网络,到万维网之父的语义网愿景,再到今天大模型时代的 GraphRAG,这项技术走过了六十年的长路。理解这条来路,才能看懂它现在在大模型时代扮演的角色。这篇文章按时间线梳理知识图谱的完整演进。
一、1960 年代:语义网络——用图表达知识的第一步
知识图谱的思想源头是 语义网络(Semantic Network)。20 世纪 60 年代,认知科学家 Quillian 提出,把概念表示为节点、概念之间的关系表示为连线,用一张图来模拟人类知识的存储方式。
经典的实验来自 Collins 和 Quillian 在 1969 年的记忆模型实验:当问“金丝雀是鸟吗”,人的反应时间比问“金丝雀会呼吸吗”更短,说明知识在人脑中是分层存储的——“呼吸”存在更高层的动物概念上。语义网络正是对这种层级知识结构的模拟。
这套“节点 + 关系”的表示方式,奠定了此后六十年知识表示的基本形态:实体、关系、层级。今天知识图谱的每一个三元组,血脉里都流着语义网络的基因。
二、1980—1990 年代:本体工程——给知识立规矩
语义网络有一个致命缺陷:没有语义约束。“张三—喜欢—李四”和“李四—位于—北京”,这两条关系完全不是一个性质,但语义网络里都是一根线。缺乏形式化定义,知识就无法严格推理。
于是 1980 年代兴起了本体工程(Ontology Engineering):
- 1984 年启动的 Cyc 工程,试图人工构建覆盖常识的巨型知识库,论证了“把世界知识形式化”这件事可行,也暴露了纯人工路径的成本之巨;
- 1993 年,Gruber 给出本体最经典的定义:“概念化的明确的规范说明”——先定义清楚有哪些概念、哪些关系、什么规则,再往上堆知识。
本体工程为知识图谱留下了最重要的遗产:模式层(Schema)。今天建图谱先定本体(实体类型、关系类型、属性、约束),这套方法论直接来自这个时期。
三、1998—2011 年:语义网——让万维网“懂”数据
1998 年,万维网发明人 Tim Berners-Lee 提出下一代互联网愿景——语义网(Semantic Web):网页上的信息不只是给人看的文字,而是机器能理解的、带语义的结构化数据。
围绕这个愿景,W3C 构建了一整套技术标准:
- 1999 年,RDF 1.0:用“主语—谓语—宾语”三元组统一描述一切资源,任何知识都能拆成一句句话;
- 2004 年,OWL:网络本体语言,让本体定义有了形式化语义,支持逻辑推理;
- 2006 年,链接数据(Linked Data):Berners-Lee 提出四原则,倡导把分散的数据集用标准格式互联;
- 2008 年,SPARQL:图数据库的查询语言标准。
这十几年奠定了知识图谱的整套技术底座,但落地并不顺利:语义网标准复杂、门槛高,普通企业用不起来,一度被批评为“学术理想主义”。
四、2012 年:Google Knowledge Graph——商业命名的诞生
2012 年 5 月,Google 发布 Knowledge Graph,并留下那句著名的定位语:“things, not strings”(搜索的是事物,不是字符串)。
Google 知识图谱把三元组技术用在搜索质量上:搜“姚明”,右侧直接展示结构化信息卡——身高、出生地、效力球队、家庭成员,相关查询自动关联。搜索从“返回一堆链接”变成“直接回答知识”。
这件事的行业意义远超技术本身:
1. 证明了商业价值:知识图谱第一次在十亿用户级产品中证明自己;
2. 带火了整个领域:“知识图谱”这个中文译名在国内迅速普及,科研立项、产业投入全面启动;
3. 开源生态起步:同期的 DBpedia、YAGO 把维基百科变成结构化知识库;2012 年 Wikidata 上线,成为全球最大规模的开放协同知识库。
五、2013—2022 年:产业深耕——从通用图谱到行业图谱
通用图谱(人、地、组织)之外,这个阶段的主旋律是行业知识图谱:
- 金融:反欺诈的关联网络分析、企业风险传导链路;
- 公安:案件关联、关系网络穿透分析;
- 医疗:症状—疾病—药品—指南的知识网络,辅助临床决策;
- 电力、制造:设备知识图谱支撑智能运维、故障定位;
- 档案、出版:知识资源的关联组织与专题服务。
技术上,图数据库(Neo4j 等)成熟,构建流程形成标准范式:本体设计 → 知识抽取(实体识别、关系抽取)→ 知识融合(实体对齐、消歧)→ 质量评估 → 存储 → 更新维护。知识图谱从“愿景”变成了“工程学科”——这也是国内这十年沉淀最深的部分。
六、2023 年至今:GraphRAG——与大模型互相成就
大语言模型的爆发,一度让“知识图谱过时论”甚嚣尘上:大模型什么都知道,还要图谱干什么?
实践很快给出了相反的答案。大模型有三大顽疾:幻觉(一本正经地编造事实)、知识不可溯源、私有知识缺失。而这三点恰好是知识图谱的强项:三元组是确定的事实、可指向出处、可承载企业私有知识。
于是 2024 年微软提出 GraphRAG:先从文档中构建知识图谱和社区摘要,检索时先在图谱上找关联实体与关系,再让大模型基于图谱检索结果生成答案。相比直接对文档做向量检索,GraphRAG 在“全局性问题”和“多跳推理”上的表现显著提升——比如问“A 公司通过哪些间接投资进入了 B 领域”,纯向量检索很难跨文档拼出完整链路,图谱却天然擅长。
由此,知识图谱与大模型形成了双向奔赴:
- 图谱喂大模型:RAG 的知识底座、幻觉抑制的校验层、推理的可解释依据;
- 大模型建图谱:实体识别、关系抽取、知识融合这些原本依赖人工的环节,大模型把构建成本大幅压低。过去建一个行业图谱动辄数年的最大瓶颈,正在被瓦解。
七、六十年的主线
回看这条从语义网络到 GraphRAG 的路线,三个不变的主题:
1. 表示方式没有变过:节点、关系、三元组,六十年来一直是“点—线”的组合;
2. 形式化程度不断加深:从随手画图,到本体约束,到可推理的标准,再到与大模型的语义对齐;
3. 构建成本是永恒的瓶颈:Cyc 靠人工堆了数十年,互联网靠众包(Wikidata),大模型时代靠智能抽取——谁能低成本、高质量地把非结构化数据变成结构化知识,谁就掌握着图谱产业的命脉。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
