Agent 的 RAG 系统:从检索增强到智能体编排

AI RAG Agent 2026-05-26 约 12 分钟阅读

大语言模型(LLM,Large Language Model)很强,但有两个老问题:知识有截止日期,以及容易「一本正经地胡说」——也就是幻觉(hallucination)。 检索增强生成(RAG,Retrieval-Augmented Generation)的思路很直接:回答之前,先去知识库里找相关材料,再让模型「开卷作答」。

Agentic RAG(代理式 RAG)又往前走了一步:不再固定「检索一次 → 生成一次」,而是让 AI Agent(智能体)自己决定要不要检索、检索几次、从哪检索、结果够不够好。 这篇文章按「能落地」的视角,把 Agent RAG 系统讲清楚。

一、RAG 是什么:三件套

经典 RAG 管道可以拆成三个环节(Lewis 等人 2020 年 NeurIPS 论文奠定了这一范式):

  1. 检索(Retrieval):把用户问题转成查询,从向量库、搜索引擎或数据库里找出相关文档片段。
  2. 增强(Augmentation):把检索到的片段拼进 Prompt,作为模型回答的上下文。
  3. 生成(Generation):LLM 基于上下文生成最终回答,并尽量引用来源。
一句话:RAG = 让 LLM 先查资料再说话,而不是只靠训练权重里的「记忆」。

二、传统 RAG 够用的场景,以及三个瓶颈

对于「公司年假几天」「某 API 的默认端口是多少」这类单点事实查询,传统 RAG 往往够用:一次向量检索 + 一次生成,延迟 1~3 秒,成本也可控。

但 Gao 等人 2024 年的 RAG 综述指出,固定管线在复杂场景会遇到结构性上限:

根因在于:传统 RAG 把检索当成无状态的单步操作,而人类研究员面对难题时会规划 → 多轮查阅 → 交叉验证 → 再查缺口

三、Agentic RAG:把检索交给智能体编排

Agentic RAG 将 AI Agent 的自主决策能力嵌入 RAG 流程。Anthropic 在《Building Effective Agents》中归纳了 Agent 的三个特征: 自主性(Autonomy)、工具使用(Tool Use)、反思与调整(Reflection)。 当这三点进入 RAG,检索不再是固定步骤,而是由 Agent 动态编排的认知过程。

用户提问
    │
    ▼
[查询分析与规划]  ── 判断复杂度,拆分子问题
    │
    ▼
[动态检索]        ── 选数据源、改写 query、多轮检索
    │
    ▼
[结果评估与反思]  ── 相关吗?够吗?有矛盾吗?
    │         │
    │    不充分 ──→ 回到动态检索
    ▼
[知识整合与生成]  ── LLM 基于高质量上下文作答
    │
    ▼
[回答质量验证]    ── 是否有据、是否完整

Asai 等人在 ICLR 2024 的 Self-RAG 工作中证明:让模型学会「何时检索、如何评价检索结果」,在多个知识密集型基准上显著优于传统 RAG。LangChain、LlamaIndex 等框架随后把这一思路工程化。

四、Agent RAG 的四大核心能力

4.1 动态检索(Dynamic Retrieval)

Agent 在运行时选择检索策略:时间敏感问题优先新文档;要精确数字就查 SQL;模糊探索则用更宽的语义搜索。 若第一轮结果不够,Agent 会改写 query、换数据源、扩大或缩小范围,迭代直到信息充分——这被称为迭代式精化(Iterative Refinement)。

4.2 查询规划(Query Planning)

面对复合问题,Agent 先做查询分解(Query Decomposition),拆成多个可独立检索的子问题,并分析子问题之间的依赖顺序。 例如「比较 A、B 两家供应商的 ESG 评分及采购占比」需要先列出供应商清单,再分别查 ESG 与采购数据,最后综合——传统单次检索很难完成这种多跳推理。

4.3 自我反思(Self-Reflection)

Self-RAG 把反思分为三层:

4.4 工具使用(Tool Use)

Agent 不局限于向量库,还可调用:

五、架构演进:从 Naïve RAG 到 Agentic RAG

业界常按复杂度划分 RAG 形态(参见 Agentic RAG Survey, arXiv:2501.09136):

企业实践里,混合检索 + Cross-Encoder 重排往往是性价比最高的第一步:Recall 不够时换 embedding 没用,加上 BM25 往往立刻见效;重排则把「捞到了但排第 50」的文档推到 LLM 真正会读的前几位。

六、企业级 Agent RAG 怎么搭

6.1 多 Agent 协作

复杂系统常用角色分工:

6.2 记忆分层

6.3 框架选型(2025–2026 常见路线)

务实建议:先用框架做 POC 验证业务价值,再决定是否自建。

七、传统 RAG vs Agentic RAG 对比

因此 Agentic RAG 不是全面替代传统 RAG,而是复杂场景的增强方案——务必加一层 Query Router,简单题别走多 Agent 全流程。

八、落地时要注意什么

8.1 延迟与成本

8.2 数据与评测

RAG 质量是管线乘数效应:解析 → 切片(Chunking)→ 检索 → 重排 → 生成 → Grounding 验证,任何一环偷懒都会反映到答案上。上线后持续追踪 Recall@K、引用准确率、幻觉率与用户满意度,而不是「部署即完工」。

8.3 安全与合规

九、小结

RAG 解决「模型不知道你的私有知识」;Agent RAG 解决「复杂问题需要像研究员一样多轮查、想、改」。构建 Agent RAG 系统,核心不是堆更多 Agent,而是:路由分流、混合检索、迭代反思、可观测评测四件事做扎实。

若你的场景里超过三成查询需要跨文档综合或多步推理,Agentic RAG 值得认真评估;若主要是 FAQ 级问答,先把传统 RAG 的切片与混合检索做好,往往更划算。

参考资料

← 返回首页