在前面的章节中,我们提到了大模型有 2 个致命的缺点:一个是 “知识滞后”(不清楚训练日期之后的新闻),另一个是 “幻觉”(遇到不懂的问题容易胡说八道)。
如果小伙伴们只是使用大模型来闲聊,这可能不是什么大问题。但如果我们想把大模型接入到企业的真实业务中,比如做智能客服、内部规章问答等,哪怕有一点点幻觉或错误,都会带来严重的后果。
为了解决这些问题,AI 业界目前最主流、最核心的方案就是使用——RAG(外挂知识库)。大家别搞错了,不是 “唱、跳、RAP、篮球” 那个 “RAP” 哈。

什么是 RAG?
RAG,全称是 “Retrieval-Augmented Generation(检索增强生成)”。我们可以把这 3 个英文单词拆开,来理解它的运行过程是怎样的。
- Retrieval(检索):先去我们自己准备好的资料库里,搜索出和用户提问相关的知识文本。
- Augmented(增强):把搜出来的相关知识,和用户的原始提问拼接到一起,作为背景提示词(Prompt)发给大模型。
- Generation(生成):大模型根据我们刚刚发给它的背景知识,总结、生成最终的回答。

简单来说,RAG 就是不让大模型凭空去猜,而是先给它接入一个 “外挂” 的知识库,让它照着这个知识库来回答问题。

为什么需要 RAG?
既然大模型本身已经懂很多东西了,为什么我们还要费劲给它接一个外挂知识库呢?主要是为了解决以下 3 个核心痛点。
1. 解决知识的时效性问题
大模型的知识是 “写死” 的。比如一个模型在 2025 年底训练完成,那它就绝不可能知道 2026 年发生的事。
而通过 RAG,我们可以随时把最新的新闻、文档放进知识库,大模型就能结合这些最新资料来回答问题了。
小伙伴们可能没意识到:其实你天天在用的 AI “联网搜索”,就是一种最典型的 RAG——只不过它的 “知识库” 不是某份文档,而是整个互联网。模型先去网上搜出相关网页,再结合搜到的内容回答你。这也正是为什么开了联网之后,它就能聊训练截止日期以后发生的新鲜事了。

2. 解决企业私有数据问题
大模型肯定是没有看过你们公司的内部的规章制度、产品说明书、客户数据。如果你问它 “我们公司的报销流程是什么”,它肯定回答不上来。
有了 RAG 之后,我们只要把公司的规章制度存进本地知识库,大模型就能直接照着这些文档来回答员工的提问了。

3. 极大降低 “幻觉”
通过 RAG,我们可以在系统提示词里加上一句严格的约束:“请严格根据我提供的背景资料来回答。如果资料里没有,就直接回答 ‘不知道’。”
有了明确的客观事实作为参考,就能把大模型胡说八道的概率压到最低。

RAG 是如何工作的?
为了让小伙伴们更直观地理解,我们来看一个真实的业务场景。
假设我们做了一个 “法律咨询 AI”,并且把最新的《民法典》作为它的外挂知识库。当用户向它提问时,RAG 的工作流程是这样的:
- 用户提问:比如用户问:“租房合同没到期,房东要把房子卖了,我必须搬走吗?”
- 检索资料(Retrieval):系统不会急着把问题丢给大模型,而是先去《民法典》这个外挂知识库里搜索,找到了 “买卖不破租赁” 的相关法条文本。
- 增强提示词(Augmented):系统在后台把找出来的法条和用户的问题拼到一起,组成一段新的提示词。比如:
请根据以下法条来回答用户问题:
【法条】:租赁物在承租人按照租赁合同占有期限内发生所有权变动的,不影响租赁合同的效力。
【问题】:租房合同没到期,房东要卖房,我必须搬走吗?- 模型生成(Generation):大模型收到这段完整的提示词后,立刻发挥它强大的阅读理解能力,生成一段通俗易懂的回答:
您不需要搬走。根据法律规定,房东卖房不影响您现有的租房合同效力。我们可以这样去理解:传统的大模型是在做 “闭卷考试”,只能靠脑子里死记硬背的知识答题,记不清了就容易瞎编。而装上了 RAG 的大模型,则是在做 “开卷考试”,系统会直接把参考书递到它手上,它只要照着参考书总结答案就行了。
RAG 和微调的区别
很多小伙伴容易把 RAG 和之前介绍的 “有监督微调(SFT)” 混淆,觉得它们都是在让大模型学习新知识。其实在业务落地上,两者有着本质的区别。
- RAG:相当于给大模型 “发参考资料”,并没有改变大模型本身的参数。知识库里的资料随时可以增加、删除、修改,非常灵活,成本也极低。
- 微调:相当于给大模型 “动脑部手术”,通过改变底层参数,硬把知识塞进它脑子里。训练成本高,而且知识一旦更新,还得再花钱重新微调一次。

在实际的商业开发中,绝大多数(业内常说八成以上)企业私有化问答的需求,其实根本用不着去搞昂贵的微调,直接上 RAG 技术就能很好地解决。
另外要澄清一点:RAG 和微调并不是 “二选一” 的对头,很多时候它俩是搭配着用的。一个成熟的企业级 AI,往往会一边使用微调把 “说话的口吻、回答的格式” 调教好,一边用 RAG 给它接上 “随时更新的知识库”——一个管 “怎么说”,一个管 “说什么”,相辅相成。
RAG 难道是完美的吗?
看完前面的介绍,小伙伴们可能会觉得 RAG 简直是一个无敌的神器。但在真实的企业级开发中,RAG 也是有局限性的。
1. 极其依赖 “检索” 质量
RAG 的核心逻辑是 “先搜再答”。如果第一步从知识库里搜出来的东西就是错的、或者根本没搜到核心内容,那大模型生成的回答也必然是错的——这就是我们常说的 “垃圾进,垃圾出”。

2. 非常消耗 Token(费钱)
每次提问,系统都会把一大段背景资料塞进提示词里发给大模型。这就导致你的上下文(Context)变得非常长,而 API 都是按 Token 长度计费的,无形中就抬高了每次对话的成本。

3. 复杂文档解析困难
如果你的企业文档是纯文本(txt),那 RAG 处理起来得心应手。可一旦碰上排版复杂的 PDF——里面满是表格、双栏排版、图片和流程图——现有的 RAG 技术在提取这些复杂信息时,依然会面临巨大的挑战。
可能有小伙伴会问:“现在大模型的上下文窗口动不动就上百万 Token 了,那我干脆把所有文档一股脑全塞进提示词,不就用不着 RAG 了吗?”
理论上可以,但实际并不划算:文档稍微多一点就根本装不下,而且每次都把海量文字发过去,又慢又贵,模型还容易在一大堆内容里 “抓不住重点”。所以面对庞大的资料库,先使用 RAG “精准捞出” 最相关的那一小段,依然是目前更聪明的做法。

为什么每个人都必须懂 RAG?
说到底,RAG 并没有改造大模型本身,它只是给大模型外接了一个随时可以翻阅的资料库而已。
- 对于普通人来说:平时使用 ChatGPT、DeepSeek 或者各种智能体平台时,只要你上传了文件,或者点击了 “联网搜索”,背后用的就是 RAG 技术。搞懂了它,你就明白为什么 AI 有时会漏掉你长文档里的细节了——纯粹是因为前面 “检索资料” 那一步没找对。
- 对于开发者来说:掌握 RAG,你就掌握了一条商业密码。企业绝对不可能把内部机密文件发给外部大模型去训练,他们最急需的,就是搭建一个属于自己的 “私有知识库”。学会用 Embedding 技术对接向量数据库,这是你以后接单赚钱、开发企业级 AI 产品的核心吃饭本事。

搞懂了 RAG 的基本概念后,下一节,我们将深入 RAG 的内部,看看系统究竟是如何把文字变成机器能读懂并进行检索的 “词向量(Embedding)”的。
