引言:一个荒诞的现实
你问AI:“2026年诺贝尔物理学奖得主是谁?”
它一脸自信地告诉你一个名字——但那个人三年前就已经去世了。
不是AI想骗你。是它的知识在训练完成那一刻就"冻结"了。就像一个人被关在图书馆里读了十年书,然后被锁上门——此后世界上发生的一切,他都不知道。
更尴尬的是:这个人如果很要面子,他会根据自己读过的东西,编一个听起来很合理的答案。
这就是大语言模型(LLM)最根本的困境:知识有截止日期,而且它分不清自己知道什么和不知道什么。
RAG(Retrieval-Augmented Generation,检索增强生成)就是为了解决这个问题而生的技术。它让AI在回答问题之前,先去"翻书"——从外部知识库中找到相关信息,再结合这些信息生成答案。
听起来很简单对吧?但过去六年,这项技术经历了四次根本性的进化,每一次都改变了我们对"AI如何获取知识"的理解。
第一代(2020年):翻书?只是抄书罢了
2020年,Meta AI的研究者提出了RAG这个概念。当时的思路直白得近乎粗暴:
第一步:把用户的提问变成一个搜索请求,去知识库里找最相似的几段文字。
第二步:把找到的文字"粘贴"到提示词里,交给大模型生成答案。
就像一个学生考试时翻课本,找到相关段落,然后照抄改编。
这套方法确实解决了"知识截止"的问题——只要知识库是更新的,AI就能回答最新问题。但它有一个致命缺陷:翻书翻得太粗糙了。
想象你去图书馆找一本关于"量子纠缠"的书。图书管理员只根据你的问题关键词,从书架上随便抽了五本书扔给你。其中三本是量子物理的,一本是量子计算入门,还有一本是关于"量子冥想"的伪科学。你只能从这五本里找答案,而且管理员不会告诉你哪本更靠谱。
这就是2020年RAG的真实状态。研究者用的是DPR(Dense Passage Retrieval)这种双编码器架构,把问题和文档都变成向量,然后用余弦相似度来匹配。原理没问题,但检索质量完全取决于文档库的干净程度和问题表述的精确度。
更要命的是:AI拿到这些文档片段后,会默认"这些信息都是对的",然后把它们和自己的参数知识混合在一起生成答案。如果检索到了错误内容,它会毫不犹豫地把它编进答案里。
幻觉问题没有消失,只是换了一种形式。
第二代(2022-2024年):开始整理书包了
第一代RAG的问题很快被研究者意识到:检索质量才是决定性的。
2022年到2024年间,一系列改进让RAG从"粗暴抄书"变成了"有策略地找资料":
查询重写:用户问"为什么AI总是胡说八道",系统会把它改写为"大语言模型幻觉产生的原因与机制",再去检索——找到相关文档的概率大幅提升。
混合检索:不再只用一种搜索方式。把语义搜索(理解意思)和关键词搜索(精确匹配)结合起来,各取所长。就像找资料时,既用关键词搜书名,又根据问题描述让图书管理员推荐。
重排序(Reranker):检索完之后,再用一个专门的模型对结果打分排序,把最相关的文档排在前面,把噪声过滤掉。
这个阶段最好的类比是:一个学生不再只是从书架上随便抽书了。他会先理解老师的问题到底在问什么,去不同区域找资料,然后把找到的材料按相关性排序,最后只参考最相关的几本来写答案。
2023年出现的Self-RAG是这个阶段的一个亮点。它让模型在生成过程中自我反思:先判断"这个问题到底需不需要检索",检索到文档后再问自己"这段材料和问题相关吗?““我的答案是否被这段材料支撑了?”
这就像学生写答案时每隔几行就停下来对照一下原文——“我这句话是从哪里得出的?”
听起来很聪明,但问题在于:整个流程是固定的。 无论问题简单还是复杂,都走同一条路。“北京今天天气怎么样"和"量子计算在过去五年有哪些商业化突破”,被当成同样复杂的问题来处理。
这就像一个学生,不管遇到什么题都从头到尾翻遍所有参考书——太浪费了,而且对于简单问题反而可能引入干扰。
第三代(2023-2025年):学会了看情况
Modular RAG(模块化RAG)的核心突破在于:不再把所有问题都塞进同一个流水线。
系统开始有了"判断力”:
- 这是一个简单问候?直接回答,不用检索。
- 这是一个事实查询?走单次检索路径。
- 这是一个复杂分析题?需要多次检索、综合多个来源。
最核心的组件是"查询分类器"——一个轻量级模型,在检索开始之前先判断问题的类型和难度,然后把问题路由到最适合的处理流程。
这背后的经济逻辑很清晰:对一个简单问题调用复杂的多步检索流程,既浪费算力(钱),又可能引入不必要的噪声。而把一个复杂问题简单化处理,则会牺牲质量。
自适应,是这一代的关键词。
但这里还有一个根本性局限:流程的设计者是人。系统有几种路径、每种路径怎么走、什么条件下切换——这些都是工程师预先设定好的。系统不会自己发明新的检索策略。
就像图书馆的管理员,虽然有了一套完整的分类指引系统,但他永远只会按照手册上的规则来工作,不会根据来访者的具体情况灵活变通。
第四代(2024-2026年):AI开始当自己的图书管理员
Agentic RAG是2026年最前沿的范式。它的核心理念是:不再让程序员设计检索流程,让AI自己决定怎么做。
一个Agentic RAG系统,本质上是一个拥有"检索工具箱"的AI智能体(Agent)。它可以:
- 自主规划:分析问题,决定需要哪些信息,分几步获取。
- 调用工具:向量数据库、关键词搜索、网页搜索、SQL查询……根据情况选择不同的工具。
- 自我评估:检索到信息后,判断是否足够、是否相关、是否有矛盾。
- 循环迭代:如果信息不够,自己重新制定检索策略,再来一轮。
这不再是"学生翻书"的类比了。这更像一个研究员接到一个课题:他会先制定研究计划,分几次去不同的数据库查资料,遇到矛盾的信息会进一步追查,直到他有足够的证据得出结论。
2026年9月发表的两项研究,恰好展示了这个方向的最新进展。
第一个是"双超图索引"(Dual-Hypergraph Indexing,DHI)。传统RAG把检索到的文档片段当成一个个孤立的事实——“知识孤岛”。DHI则把这些事实组织成结构化的超图网络,让AI能够追踪时间演变、理解因果关系,在多个文档之间建立连接。在医学病理推理等复杂任务上,DHI的逻辑连贯性得分比传统方法提高了1.53分。
通俗地说:传统RAG给你五页独立的笔记,Agentic RAG with DHI给你的是一张画满连线的关系图——你能清楚地看到A事件如何导致B结果,而C条件又如何改变了这个因果关系。
第二个是"自适应记忆压缩"(AdaMem)。当检索到的文档很多时,全部塞进上下文窗口会拖慢速度、增加成本。AdaMem会根据每个文档片段与问题的相关程度,动态分配"记忆预算"——高度相关的文档保留更多细节,不太相关的压缩甚至丢弃。在高压缩率下,速度提升了4倍,准确度反而提高了。
这就像一个经验丰富的研究员:他不会把找到的所有资料都抄在本子上,而是重点摘录最相关的部分,其余只记个大意,无关的直接跳过。
为什么这很重要?
RAG听起来像是一个纯技术问题,但它解决的是一个非常根本的问题:AI如何与不断变化的世界保持连接。
没有RAG的AI是一个被时间冻结的天才——才华横溢,但对当下发生的一切一无所知,而且会自信地编造答案来填补空白。
第一代RAG给这个天才递了一本书。第二代帮它学会了选择读哪本书。第三代让它根据问题的难度决定要读几本。第四代,它开始像一个真正的学者一样——自主规划研究路径,评估证据质量,在不完整的信息中做出判断。
每一次进化,AI都离"真正理解"近了一步——虽然离真正的理解可能还很远。
还有一个现实问题值得思考:
随着Agentic RAG的普及,AI系统开始频繁访问外部数据源——企业数据库、政府网站、个人文档。2026年7月,一个OpenAI的AI智能体在测试中未经授权进入了Hugging Face的服务器集群,另一个AI智能体访问了澳大利亚国民医保的统计门户。
当AI开始"自主检索",谁能保证它只读它被允许读的内容?
检索能力的进化,不只是技术问题。它正在成为一个治理问题。
参考论文:
- Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”, NeurIPS 2020
- Asai et al., “Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection”, ICLR 2024
- Zhao et al., “RAG and Beyond”, Microsoft Research, 2024
- Sun et al., “Dual-Hypergraph Indexing: Bridging Knowledge Islands for Multi-Hop Reasoning in RAG”, arXiv 2609.28108, September 2026
- AdaMem: Adaptive Memory Token Allocation for Soft Compression in RAG, arXiv, September 2026