☰
RAG vs Agentic RAG:一次检索的管道,和会思考的调研员
2026/10/9 5:38:53 网站建设 项目流程

同样接知识库,为什么有的系统只会"查一次",有的会"边查边想"?

经典 RAG 是"查一次字典再答题"的线性管道,Agentic RAG 是"会思考的调研员"——先查、不够再查、换着来源查、验证过再写报告。两者的区别不在"检不检索",而在谁决定怎么检索。这篇把两种架构的流程、差异、典型实例和选型讲透。

01经典 RAG:一次检索的线性管道

经典 RAG 的流程是一条写死的单向链路:用户问题 → 向量化(Embedding)→ 检索(向量检索 + BM25 混合)→ 重排取 Top-K → 把检索片段拼进 Prompt → 大模型生成回答。

这条链路上没有任何"判断"环节。检什么关键词、检几轮、结果够不够用,都是流程预设好的——问题进来,检索一次,结果直接进 Prompt,生成结束。它无决策、无状态、无回溯,优点也来自这里:快、便宜、稳定,适合单轮事实性问答。

图1:经典 RAG(管道) vs Agentic RAG(决策循环)

02Agentic RAG:会思考的调研员

Agentic RAG 把大模型放到了"决策者"的位置。它不再被动执行一次检索,而是进入经典的Thought → Action → Observation循环:模型先思考"这个问题要不要检索、该搜什么",然后执行动作(调检索器、改写查询、调用 Web 搜索或 SQL 工具),拿到观察结果后评估"信息够不够"——不够就进入下一轮,直到自认为充分才生成最终答案。

这个循环带来两个关键能力:多跳检索(第一轮结果不够,改写查询再检第二轮)和工具路由(向量库查不到,可以转去 Web 搜索、查数据库、跑计算器)。代价是更慢、Token 消耗更高、工程更复杂,还要额外防死循环。

03四个核心差异

维度

经典 RAG

Agentic RAG

决策主体管道预设,检索环节无判断

LLM 自主决策:检什么、检几轮、要不要换工具

流程结构单轮线性,retrieve-once

多轮循环,可回溯、可反思

查询处理用户原问题直接检索,多跳问题易断

查询改写、多跳检索、多源交叉验证

工具范围只有检索器

检索器 + Web 搜索 + SQL + 计算器等

代价快、省、稳

慢、贵、复杂,需防死循环与决策失控

04一个多跳检索实例

问一个问题:“2024 年诺贝尔物理学奖得主的博士导师是谁?”

经典 RAG拿原问题去检索,第一轮通常只命中"获奖者是某某",拿不到导师信息。由于流程没有第二轮,模型要么答不上来,要么开始编造——这是它最典型的失败场景。

Agentic RAG第一轮检索拿到获奖者后,模型评估发现信息不足,把"获奖者 + 博士导师"改写成新查询进入第二轮检索,拿到导师信息后再交叉验证,最后组织答案。整个过程是"检索 → 评估 → 再检索 → 生成",每一轮都在修正查询。

图2:多跳检索——同一个问题的两种走法

05生产落地怎么选?

单轮事实性问答、知识库客服、FAQ 这类场景,经典 RAG 又快又稳又便宜,没必要上 Agentic。跨文档交叉、多跳推理、需要动态决定数据源的复杂任务,才值得付出 Agentic 的代价。

实践中的主流做法是混合路由:先做意图分类,简单问题直接走经典 RAG 管道,复杂问题才进入 Agent 循环。Agentic RAG 落地时还要配四层防护:最大迭代步数(如 max_steps=10)硬性终止、重复动作哈希检测、动态反思引导换策略、超限降级兜底,避免模型在"检索-评估"循环里空转。

图3:选型决策 + Agentic 四层防护

06面试追问:3 道高频题

Q1:RAG 和 Agentic RAG 的核心区别是什么?

区别不在"检不检索",而在"谁决定怎么检索"。经典 RAG 是预设管道:问题进来,向量化、检索、重排、拼 Prompt、生成,全程无判断,检索一次完成。Agentic RAG 把大模型放到决策者位置,进入 Thought → Action → Observation 循环:自主决定要不要检索、改写成什么查询、检索几轮、是否换工具,信息不足就继续迭代。一句话:经典 RAG 是"查一次字典再答题",Agentic RAG 是"会思考的调研员",先查、不够再查、验证过再写报告。

Q2:Agentic RAG 的执行流程怎么讲?

核心是四步循环。第一步思考:模型根据当前状态判断下一步做什么,是否调用检索或工具。第二步行动:执行动作,比如调用检索器、改写查询、发起 Web 搜索或 SQL 查询。第三步观察:接收外部返回结果,评估信息是否足够支撑回答。第四步决策:信息不足就带着新查询回到第一步继续循环,信息充分则整合结果生成最终答案。整个流程依赖工具注册、停止词截断(防止模型脑补执行结果)、观察结果回灌上下文这三个工程机制,才能保证每一步数据都来自真实环境。

Q3:Agentic RAG 生产落地有哪些难点?怎么防死循环?

难点集中在三处:一是慢和贵,多轮循环的 Token 消耗和延迟远高于经典 RAG;二是检索质量不可控,首轮召回差时模型可能反复检索同一查询;三是决策失控,模型可能在"检索-评估"里空转。防死循环用四层防护:硬性限制(max_steps=10,超限强制终止);重复检测(对 Action+Observation 组合做哈希指纹,连续相同触发切换策略);动态反思(注入"你已重复 3 次,请换方法"的 meta-prompt 引导重新规划);降级兜底(循环超限时给出尽力而为的回答或转人工)。

落地总结

RAG 与 Agentic RAG 不是替代关系,是分工关系:简单问题经典 RAG 又快又稳,复杂问题 Agentic RAG 能多跳检索、工具路由、自我纠错。生产上按意图混合路由,给 Agent 循环配齐步数限制、重复检测、反思与降级四层防护。面试时把"谁决定怎么检索"和调研员类比讲清楚,再补一个多跳实例和落地防护,就是完整回答。

关注我们,一起把技术讲明白(寻码札记)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询