从搜索引擎到 RAG:检索技术的三代演进

我们每天都在用检索:搜网页、查文档、问 AI 助手。但很少有人意识到,支撑这些体验的检索技术在过去三十年经历了三次范式更替——从关键词匹配,到语义理解,再到检索增强生成。每一次更替,解决的都是上一代“答不上来”的问题。这篇文章把三代检索技术的原理、代表技术和适用边界讲清楚,帮你看懂企业知识库、智能问答这些系统背后的技术选择。
一、第一代:关键词检索——字面匹配的黄金时代
第一代检索的核心思想朴素至极:用户输入的词,和文档里出现的词,字面一致就算相关。
代表技术按时间线排:
- 布尔检索:用“与、或、非”组合关键词,图书馆卡片目录时代的电子化延续;
- TF-IDF(20 世纪 70 年代):词在当前文档出现越多、在全库出现越少,权重越高——第一次给“相关度”算了分;
- BM25(1994 年):在 TF-IDF 基础上引入饱和与长度归一,成为关键词检索的事实标准排序函数,至今仍是众多搜索引擎的基线;
- PageRank(1998 年):利用网页链接关系评价页面权威度,让 Google 从一众搜索引擎中崛起。
工程基石是倒排索引:预先建立“词→文档列表”的映射,查询时直接取交集并排序,毫秒级响应十亿级文档。
第一代的死穴:只认字面。用户搜“打印机不动了”,文档写的是“打印任务挂起”——一个字都对不上,文档再相关也检索不到。术语不一致、同义改写、错别字,都是关键词检索的天敌。
二、第二代:语义检索——让机器“看懂”意思
第二代的核心突破是向量表示:把文本映射成高维空间中的一个点,语义相近的文本距离相近,“意思像”第一次变得可以计算。
关键节点:
- 词向量(2013 年前后):word2vec 把词映射成向量,“北京—巴黎 ≈ 法国”这类语义关系可以被算术表达;
- 预训练语言模型(2018 年):BERT 等模型根据上下文动态计算词义,“苹果手机”和“苹果好吃”里的“苹果”不再是同一个向量;
- 稠密检索 DPR(2020 年):用双塔结构分别编码查询和文档,匹配从词面比对变成语义向量比对,专门训练的检索模型在开放域问答检索上大幅超越 BM25;
- 向量数据库兴起:Faiss、Milvus 等支撑起十亿级向量的近邻搜索。
第二代的死穴:语义检索擅长“找相关的”,但不解决“答案从哪来”。模型可以理解你问的是什么,但知识仍受限于检索到的文档本身;而且文档里的知识没有被“组织”起来,问一个需要跨文档综合的问题,依然力不从心。
三、第三代:RAG——检索与生成的合流
2020 年,Facebook AI 研究团队发表论文正式提出 RAG(Retrieval-Augmented Generation,检索增强生成):把检索模块接到生成模型前面——先检索相关文档,再让模型基于检索结果生成答案。
大语言模型爆发后,RAG 迅速成为企业知识库的事实标准架构,原因很直接:
- 知识可更新:模型不用重新训练,更新文档库就能更新答案;
- 答案可溯源:回答附带引用的原文出处,可信度可验证;
- 私有数据可用:企业内部文档、档案、制度不需要“训练进”模型,检索出来即可用;
- 幻觉可控:让模型“看着材料答题”,而不是“凭记忆答题”。
第三代内部仍在快速演化:
- 混合检索:关键词(BM25)与向量检索并行、结果融合,兼得精确匹配与语义泛化——实践中对专有名词、编号类查询,BM25 仍不可替代;
- 重排序(Rerank):召回后用更强的交叉编码器精排,把最相关的片段顶到前面;
- GraphRAG(2024 年,微软提出):把知识图谱引入 RAG,先从图谱中检索关联实体和关系再生成,专治“需要跨文档、多跳推理”的复杂问题;
- Agentic RAG:让智能体自主决定检索什么、检索几轮、何时停止,检索从“一次查询”变成“一个过程”。
四、三代技术怎么选:一张决策清单
三代技术不是取代关系,而是叠加关系。选型的实用建议:
1. 精确匹配为主(编号、术语、人名、法规条文号)→ BM25 关键词检索仍是性价比之王;
2. 口语化提问、同义改写多(客服、站内搜索)→ 向量语义检索必须上;
3. 要求答案带出处、私有知识问答、文档持续更新(企业知识库、档案问答)→ RAG 架构;
4. 需要跨文档综合、多跳推理(情报分析、科研综述、复杂业务问答)→ GraphRAG,前提是先有知识图谱;
5. 绝大多数真实系统→ 混合检索 + 重排序 + RAG 的组合流水线。
五、检索演进的底层逻辑
回看三代更替,有一条清晰的主线:检索的对象从“字”升级到“义”,再升级到“知识与推理”。
- 第一代比字面:快、准、死板;
- 第二代比语义:活、泛、无出处;
- 第三代组合拳:语义检索找材料、知识图谱做关联、大模型做综合、引用标注保可信。
对拥有大量文档资产的组织来说,这个演进方向意味着一件事:文档的加工深度,决定未来检索系统的上限。OCR 扫描只解决“能搜到字”;元数据著录解决“能分类找到”;而要让 RAG 真正答好问题,文档需要被切分、结构化、语义化,甚至沉淀为知识图谱。检索技术每前进一代,对数据加工的要求就深一层。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注、EPUB电子书等方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
