别再只切chunk灌向量了,RAG的重心已经移到了自主决策层

2023 年我头一回上手 RAG,翻遍全网教程,清一色一个配方:文档切 chunk,灌向量库,查询取 top-k,塞 prompt,完事。我信了。真信了。
直到我在自己产品里把这条管道跑通,发现幻觉率根本压不住,用户反馈里全是"你答的跟我文档里写的对不上"。那时候我才意识到,我用的那套东西,顶多算 RAG 的婴儿期。
大部分人还停在"切 chunk 做向量"的阶段,以为自己在用 RAG。真正的 RAG 已经进化到 AI 自己决定用什么工具、查几轮、怎么合成。这中间差的不是几篇论文,是"固定管道"和"自主智能体"之间的范式鸿沟。

先说我的判断:RAG 不是一条线,是一棵还在分叉的树
很多人跟我聊 RAG,开口就是"检索增强生成嘛,先搜后答"。我每次都得纠正:你把一个还在快速分裂的技术树,压缩成了一个固定方案。
从 2020 年 Lewis 等人的原始论文算起,到今天,我数下来至少五代。每一代要解决的核心问题都不一样,不是简单的"上一版加个功能":
| 阶段 | 时间 | 核心解决的问题 | 一句话 |
|---|---|---|---|
| 基础 RAG | 2020 | 知识不在模型里 | 先搜后答 |
| 模块化 RAG | 2022–2023 | 管道太僵硬 | 像乐高一样组合 |
| 反思+图谱 | 2023–2024 | 检索到垃圾也不知道 | 给 RAG 装质检员和结构 |
| 路由优化 | 2024–2025 | 什么都走 RAG 太贵 | 简单直答,复杂才检索 |
| Agentic RAG | 2025–2026 | 固定流程不够用 | AI 自己决定怎么找 |
大方向我很确定:从人画管道,走到 AI 自己决定怎么找信息。这条线没有终点,但拐点已经过了。
2020 到 2023:从"无脑检索"到"模块化乐高"
起点我熟,2020 年 Lewis 等人那篇 RAG 论文:DPR 稠密检索 + 向量相似度 + 生成器。它头一回让 LLM 挂上了"外接知识库",幻觉和时效性问题缓解了一截。
但问题也一眼就能看到——无脑检索。所有文本一律切 chunk 做向量索引,查询取 top-k 收工,chunk 之间互不相干。我 2023 年踩的坑全在这一步:chunk 切太小,检索回来全是碎片,模型拼不出完整答案;chunk 切太大,噪音太多,top-k 里一半是废话。碰上稍微复杂点的问题,整条管道就歇菜。
2022 年 ColBERTv2 出手,把"单向量匹配"换成 token 级多向量 + MaxSim 延迟交互,匹配精度上了一个台阶;残差压缩又把存储压下去 6–10 倍。检索器本身由粗转准了。
差不多同一时期,Modular RAG 的思路冒出来:把 RAG 拆成一组可编排的模块,检索、重排、生成,像乐高一样按需拼装。管道从焊死变成可组合。
我当时的体感是:终于不用把整条链路写死在一个脚本里了。但说到底,它还是固定流程——你设计好管道,它就照着跑,多一步都不会。

2023 到 2024:给 RAG 装上"质检员"和"知识图谱"
上一代最让我头疼的坑:检索回来一堆垃圾,系统自己发现不了。
top-k 拿回的结果质量参差,生成器不管三七二十一全收,出来的就是"一本正经地胡说八道",还带着来源,看着挺像那么回事。我踩过一次,上线那天用户截图发给我,附了句"你确定这是从我们文档里找的?"——我确定,但找的是个错误段落。
Self-RAG 和 CRAG,就是给 RAG 配上的"质检员"。
| 方案 | 做法 | 解决什么 |
|---|---|---|
| Self-RAG | 用反思 token 让模型自己判断:要不要检索?检索到的对不对? | 模型不再无脑用检索结果 |
| CRAG | 轻量评估器三路径:正确→直接用;错误→重写或联网;模糊→混合 | 检索到垃圾时自动纠偏 |
同一时期,另一条线在补"结构"这块短板。
RAPTOR 用递归摘要树组织文档,专治全局性、多跳、总结类问题。我实测下来,向量检索擅长局部匹配,"这篇文档整体在讲什么"这类问题它确实答不了,RAPTOR 补的就是这个。
GraphRAG 走得更远:先把文本抽成实体和关系构成的知识图谱,再靠图谱做多跳推理。微软的 GraphRAG 用 Leiden 社区摘要做全局问答,HippoRAG2 用个性化 PageRank 做精准路由。
但图谱路线有个硬伤,我算过账:全量构建太贵。后来的 LazyGraphRAG 就是冲着这个问题来的。

2024 到 2025:不是什么问题都值得走 RAG
前三代都在往"更准、更强、更结构化"上卷。到了 2024 年,我撞上一个很土的问题:
简单问题也走 RAG,成本太贵了。
"今天周几"犯不着查向量库,"这段代码有没有 bug"也用不上知识图谱。Adaptive RAG 的思路很直白:按查询复杂度动态路由,简单问题直接交给 LLM 答,复杂问题才走多步检索。我在自己的产品里落地这个路由逻辑时,发现光这一层就把单次查询成本砍了大半。
同一时间,LazyGraphRAG 把图谱路线的成本问题解决掉了:社区摘要推迟到查询时才计算,索引时不预算,索引成本压到 GraphRAG 的 0.1%。图谱从此不再是巨头专属,我这种小团队也能玩。
2M token 上下文窗口出现后,总有人问我:长上下文能不能直接取代 RAG?
我的回答一直是:取代不了,但可以分工。
- 简单查询走 RAG(几分钱)
- 复杂多跳走长上下文(更贵但更准)
- 视觉文档走 ColPali
ICLR 2026 的 GraphRAG-Bench 给出一条经验法则:图的价值随查询复杂度一起上升。简单问题上图谱没优势,复杂多跳问题上它碾压纯向量。这跟我自己跑 benchmark 的体感一致。
同期小火过一阵的 SAG(Search-Augmented Generation),本质是绕过向量库直接调搜索引擎。思路没错,但我个人觉得格局偏小;等 Agentic RAG 成型,搜索只是工具箱里的一个选项。SAG 更像 RAG 管道越修越复杂时的一次实用主义反弹,算不上主线进化。
这一代最核心的认知,我反复跟团队讲:RAG 不能一刀切,得按需分流。

2025 到 2026:AI 自己决定怎么找信息
终于轮到今天这一代:Agentic RAG。
前面所有代际有个共同底色:人设计管道,系统照管道跑。管道是越来越灵活了,有质检了,会路由了,可流程始终是人画的。我画,你跑,画错了你也不改。
Agentic RAG 把最后这一层也交了出去:用什么工具(向量库/网页/API/SQL)、查几轮、结果怎么合成,全由 AI 智能体自己定。
更激进的是 RL 端到端训练路线。
| 方案 | 做法 | 效果 |
|---|---|---|
| Search-R1 | 用 RL 训练 LLM 学会”何时搜、搜什么” | Qwen2.5-7B 上比普通 RAG 提升 41% |
| DeepRetrieval | 直接以检索指标(recall@k、NDCG)为奖励优化查询 | 查询质量本身被强化学习优化 |
| MCTS-RAG | 蒙特卡洛树搜索融进推理 | 把”找信息”变成搜索树博弈 |
这条线真正的意义,是范式本身的跳跃,跟某个方案提升几个百分点没关系:
从"固定流程"跨向"会自己找信息的智能体"。
这跟我观察到的 Agent 领域大趋势完全一致。我在《组织还在信息化,别人已经在跑智能体》里写过:核心变化在于执行主体从人换成了 AI,工具变强只是表象。RAG 这条线,走的是同一个方向。

说回我自己 2023 年的体感
2023 年我做 RAG 时踩的坑,如今看个个是教科书:
- chunk 切太小,检索回来全是碎片,模型拼不出完整答案
- chunk 切太大,噪音太多,top-k 里一半是废话
- 没加重排,向量相似度高不等于语义相关
- 没有质量评估,检索回错误信息照样生成,用户根本分辨不出
这些问题到 2024 年都有了系统性解法。可大部分企业的 RAG 系统,到今天还停在 2022 年的水平:切 chunk、灌向量、取 top-k,一条管道走到底。
怪不到他们头上,只是没人提醒过:"你的 RAG 还停在婴儿期"。
我自己的产品里,知识检索、PPT 生成、图文创作这几条流水线,已经从基础 RAG 迁到了带路由和质量评估的架构。基础 RAG 的幻觉率在真实业务里根本扛不住,这一步是业务逼出来的,不是技术洁癖。
压成五句
- RAG 是一条还在快速分裂的进化路线,从 2020 年到 2026 年,至少五代
- 大部分企业还停在 2022 年的"切 chunk 做向量",以为自己在用 RAG,其实只碰到了起点
- Self-RAG、CRAG 给检索装了质检员,"检索到垃圾也不知道"是最常见也最致命的坑
- GraphRAG 走结构化路线,LazyGraphRAG 把成本打了下来,图的价值随查询复杂度上升
- Agentic RAG 是当前终态,AI 自己决定用什么工具、查几轮、怎么合成,从固定管道走到自主智能体
土话一句:
别再张口就说"我们上了 RAG"了,先弄明白你的 RAG 是哪一代的。
2023 年切 chunk 做向量,2026 年 AI 自己找信息。技术在进化,你的 RAG 也该跟着升级了。
关于作者 · Alex
我是 Alex,12 年+ 软件架构经验,专注 AI 私有化部署、DevOps 与云原生架构。这里持续分享一线技术实践与职业成长。


