文章目录
- 1. 前言
- 2. 什么是 RAG ?
- 2.1 基础定义
- 2.2 三大核心组件
- 2.3 基础工作流(朴素RAG)
- 2.4 普通 LLM vs RAG
- 2.5 典型应用场景
- 2.6 发展历史
- 3. 为什么需要 RAG ?
- 3.1 LLM 底层本质
- 3.2 LLM 如何学习
- 3.3 LLM 会产生幻觉
- 3.4 RAG 如何解决幻觉问题
- 4. 实现方案
- 4.1 朴素 RAG(Naive RAG)
- 4.2 高级 RAG(Advanced RAG)
- 4.3 模块化 RAG(Modular RAG)
- 4.4 智能体化 RAG(Agentic RAG)
- 4.5 图增强 RAG(GraphRAG)
- 4.6 各方案对比简表
- 5. 开源框架/平台
- 5.1 RAGFlow(⭐ ~88k)
- 5.2 LlamaIndex(⭐ ~46k)
- 5.3 LightRAG(⭐ ~35k)
- 5.4 腾讯 WeKnora(⭐ ~20k)
- 5.5 Haystack 2.x(⭐ ~24k)
- 5.6 txtai(⭐ ~13k)
- 5.7 阿里 PAI‑RAG(⭐ ~ 0.5k)
- 6. 小结
1. 前言
在上一篇中,我们了解了上下文工程(Context Engineering)中的:
- 三大基础组件:上下文检索与生成、上下文处理、上下文管理。
- 四大系统实现:
RAG系统、记忆系统、工具集成推理、多智能体系统。
RAG属于中层四大系统实现之一,由底层三大基础组件组合构建而成。它以「上下文检索与生成」为核心,同时复用上下文处理、上下文管理能力,用来实现外部知识注入;RAG作为架构骨架,进一步结合业务需求,可实现知识库问答等上层Agent/AI应用。工程中RAG常与记忆、工具推理组合,共同构建复杂智能体。
基础组件属于底层能力模块,是上下文工程最基础的 “零件库”,提供信息获取、信息加工、信息存储管理的基础能力。四大系统属于中层架构范式,组装基础组件形成标准化架构骨架,是通用技术方案,还不是面向用户的成品。
基于四大系统架构,结合业务需求开发出来,构建面向终端使用的最终应用,也就是Agent/AI应用,比如智能助手、知识库问答、办公Agent、多角色协同机器人等业务产品。
2. 什么是 RAG ?
2.1 基础定义
RAG(Retrieval‑Augmented Generation)检索增强生成,是一种将外部知识库检索与大模型文本生成相结合的技术范式:不修改大语言模型本身权重,推理阶段先从外部知识库检索相关资料,再把检索得到的上下文交给大模型,由大模型基于检索回来的真实材料生成回答。
公式表达:LLM + your data= 大模型 + 你的私有/外部数据
原始大语言模型训练依赖公开互联网数据,企业私有文档、内部业务资料、实时互联网信息,通常不在模型训练数据集中,裸LLM会产生幻觉、无法回答业务专属问题。
在《面向大语言模型的上下文工程综述》的三层架构中:
- 底层:三大基础组件(上下文检索与生成、上下文处理、上下文管理)
- ✅中层:四大系统实现之一 RAG系统
- 上层:
Agent/AI应用(知识库问答、文档助手等产品)
RAG不是底层单一组件,而是一套拼装好的系统架构范式,核心依赖「上下文检索与生成」组件,同时复用上下文处理、上下文管理能力。
简单理解:大模型本身参数里存储的知识叫参数化知识;RAG从外部文档库拿到的资料叫非参数化知识,把检索出来的资料组装进上下文C = A ( c 1 , c 2 , … , c n ) C=\mathcal{A}(c_1,c_2,\dots,c_n)C=A(c1,c2,…,cn),交给大模型参考再输出答案。
解决痛点
- 幻觉问题:让回答引用真实文档证据,减少模型凭空编造内容;
- 知识时效性:模型训练完成之后新知识无法写入权重,
RAG可以读取实时更新的外部文档; - 领域私有知识:企业内部文档、业务数据不需要微调模型,直接通过检索注入;
- 成本可控:相比模型微调,
RAG改动知识库即可更新知识,不需要重新训练权重。
我给你精简、干净、可直接放进技术博客 / 面试背诵的 300 字标准版:
2.2 三大核心组件
一套基础的RAG系统由**知识库、检索器、生成器(LLM)**三大核心组件构成。
知识库是RAG的数据底座,用于存储权威、真实、最新的外部资料,包括业务文档、手册、合同、私有数据等。原始文档经过解析、清洗、分块、向量化后,存入向量数据库,为检索提供可靠数据源,弥补大模型参数知识有限、过时的缺陷。
检索器负责理解用户问题,根据用户Query从知识库中精准召回相似度最高的文本片段,过滤无关内容,输出高质量参考上下文,为模型提供作答依据。
生成器即 LLM,接收用户问题与检索得到的真实资料,强制基于外部参考内容生成答案,不再依赖模型内部参数脑补。
2.3 基础工作流(朴素RAG)
朴素RAG(Naive‑RAG) 是最基础、最简单版本的检索增强生成,线性直来直去的RAG流水线,没有额外优化模块。
朴素RAG一共4个工作步骤:
- 索引阶段:原始文档切分,通过
Embedding向量化,向量与文本存入向量数据库,离线完成知识库构建。 - 查询阶段:接收用户提问,将问题向量化,在向量库中召回相关文档片段。
- 组装上下文:将用户
query和检索得到的参考片段,拼装成完整提示词送入LLM。 - 生成输出:大模型基于检索资料输出最终回答。
朴素RAG属于固定线性流水线,短板明显:缺少查询改写能力,多跳推理表现差;复杂问题场景容易召回无关片段,依旧会产生幻觉。
2.4 普通 LLM vs RAG
普通LLM流程:用户Prompt直接送入大模型,依靠模型参数内训练知识生成回答。缺点是不能使用私有数据、知识过时,容易产生幻觉。
RAG引入检索环节:用户问题交给检索器,从知识库召回相关文档片段,将问题与参考文档拼接为增强提示词再交给LLM,让模型基于外部资料输出答案。
RAG收益显著:可以注入私有业务知识、缓解幻觉;更新知识只需要维护知识库,无需微调大模型,还可以实现答案溯源。但代价是增加检索带来的延迟,提升系统复杂度。
RAG实现职责分离:检索器负责找事实,LLM专注文本生成。
2.5 典型应用场景
RAG核心价值:不改动大模型权重,接入外部私有/实时知识,降低幻觉,支持溯源,下面是工程落地高频场景。
企业内部知识库问答(最主流)
对接内部手册、合同、制度、FAQ、运维文档。员工自然语言查询内部资料,不用手动翻文档;支持客服、内部助手。智能客服与售后机器人
把产品手册、故障方案、售后政策存入知识库。用户咨询产品问题,基于真实资料回复,减少幻觉,回答可附带来源。文档分析助手(PDF/卷宗/报告)
法律合同、财报、研究论文、项目卷宗。对长文档做问答、摘要、条款提取,快速定位关键信息。垂直行业助手
- 金融:研报、公告问答;
- 医疗:院内规范、诊疗手册查询;
- 政务:政策文件解读。
实时信息问答
对接搜索引擎作为知识库,获取大模型训练截止时间之后的新闻、事件,解决知识过时问题。开发者助手
接入私有代码文档、接口文档、内部技术规范,做研发问答、接口解释。教育知识库
课程讲义、题库资料,基于教学资料答疑,减少编造知识点。
RAG不擅长纯创意创作,这类场景直接使用原生LLM即可。
2.6 发展历史
早期RAG仅仅把文档切分成文本块做相似度检索;2026年的RAG已经演进为动态上下文编排系统,与上下文工程整套思想完全对齐。
行业普遍认为超大长上下文与RAG属于互补:RAG负责从海量外部资料做粗筛选,长上下文负责局部文档精读。
RAG演进可以划分为5个阶段,下面整理关键里程碑事件:
| 时间 | 里程碑 | 核心意义 |
|---|---|---|
| 2020 | Meta NeurIPS 2020正式提出RAG范式;DPR稠密检索论文发表 | RAG范式正式诞生,确立稠密检索+生成器的基础架构,区分参数化/非参数化知识 |
| 2021‑2022 | REALM、RETRO、WebGPT | 预训练阶段融合检索;验证大规模检索增强可行性;检索增强走向工业界原型 |
| 2023 | ChatGPT爆发;Advanced RAG普及;LangChain、LlamaIndex生态爆发 | 企业大量落地RAG,朴素RAG暴露出短板;查询改写、重排序、混合检索等高级技术大规模使用 |
| 2024‑2025 | Modular RAG模块化RAG、GraphRAG图增强RAG、Agentic‑RAG智能体RAG | RAG从静态流水线走向动态可编排架构;知识图谱、智能体规划融入RAG系统,也是《上下文工程综述》重点论述的方向 |
| 2026 | RAG进入上下文引擎时代,工业化落地与前沿研究并行 1. Agentic‑RAG从科研走向生产;混合检索、重排序成为工业系统默认标配 2. 多模态RAG、记忆‑RAG深度融合;轻量化GraphRAG实现大量开源 3. MCP等标准化协议兴起,检索成为Agent可插拔组件 4. TREC‑RAG、MTRAG多轮RAG等评测基准大量出现 5. 行业形成共识:超大上下文窗口不会取代RAG,二者协同;上下文工程成为RAG顶层设计思想 | RAG不再简单等同于“检索+拼接提示词”,升级为动态上下文编排系统;将检索、记忆、工具调用统一纳入上下文工程框架,重点关注系统可靠性、复杂业务工程落地 |
💡小提示:上下文工程综述论文是
2025年7月发布,2026是该思想大规模落地RAG、Agent的产业年份。
3. 为什么需要 RAG ?
3.1 LLM 底层本质
底层本质:高级自动补全
大语言模型的底层本质,是一套概率式自动续写系统。它并不会真正“理解”语义,而是依托前文内容,反复推算后续词元的出现概率,一步步产出整篇文本。
Token生成完整流程:
- 上下文接收处理:把用户提问、已经生成的内容合并,整理成模型可识别的输入状态。
- 概率分布计算:神经网络利用训练习得的海量语言规律,为词库中每一个候选
Token算出对应的发生概率。 - 采样选出下一词元:基于概率分布做采样,挑选出本次输出的
Token,并非永远选取概率最高项。 - 迭代循环输出:将新生成
Token拼接到原有上下文末尾,重新走整套流程,直到命中停止条件,生成结束。
举例,输入句子:
今天天气真好,太阳正基于概率,模型可以生成多个通顺合理的续写:
高高挂在天上 暖洋洋地照耀大地3.2 LLM 如何学习
LLM学习分为两大核心阶段:
- 预训练(
Pre‑training) :海量文本的自学阶段(造脑),产出Base基座模型。 - 后训练(
Post‑Training):预训练完成之后,在基座模型权重基础上,开展的全部微调与对齐工作统称后训练。
预训练阶段,模型初始参数随机,只会输出乱码。以海量无标注文本为原料,核心任务是预测下一个 Token:输入上文,模型预测后续文本,对比真实结果计算误差,通过反向传播迭代调整参数,习得语法、常识、逻辑,产出** Base基座模型**。基座擅长文本续写,但不会听从人类指令。
后训练(Post‑Training)在基座之上做对齐。先通过SFT监督微调,用指令‑回答样本,教会模型理解并响应指令。再做偏好对齐,可采用RLHF或DPO,基于好坏回答数据优化输出质量,叠加安全、工具调用训练,得到可直接对话的Chat模型。
推理阶段权重完全冻结,仅循环预测
Token生成回复,不会让模型实时学习。
3.3 LLM 会产生幻觉
LLM本质是生成概率上通顺的词序列,学习训练数据中的统计模式,并不以输出客观事实为优化目标。这里有一个关键认知:Truthful ≠ probable(真实不等于概率高)。文本读起来流畅合理,只代表该文本组合在统计上概率更高,不代表内容属实。
当出现知识缺口,比如训练数据缺失、信息过时,模型缺少对应事实依据。但为了完成续写,它会依靠统计规律脑补内容,于是产生幻觉:语气笃定地编造不存在的人名、文献、数据与事件。模型没有真实认知,只是不断预测下一个Token。
幻觉无法彻底根除,只能缓解。落地业务时,切忌直接采信大模型给出的事实、数据,一定要做校验。
常用手段包括:
RAG检索增强,引入外部可信资料;- 优化提示词,鼓励模型坦诚说不知道;
- 事实类输出必须人工复核。
幻觉并非程序
Bug,是大语言模型与生俱来的特性,根源来自模型的生成逻辑。
3.4 RAG 如何解决幻觉问题
RAG(检索增强生成)是解决幻觉最有效的落地方案。
核心思想:不让模型靠参数脑补知识,强制依靠外部真实素材作答。
通过外接实时、可信数据,大幅降低模型编造概率,有效解决知识过时、事实错误、幻觉虚构等问题。
核心思路:不让模型只靠内部参数记忆知识,外部拉取真实参考资料作为上下文,降低幻觉。
4. 实现方案
按照上下文工程综述的分类,RAG分为:朴素RAG、高级RAG、模块化RAG、智能体化RAG、图增强RAG(GraphRAG),另外还有RAPTOR、Self‑RAG等代表性变体方案。
4.1 朴素 RAG(Naive RAG)
流程:用户Query→ 向量相似度检索 → 拼接片段 →LLM生成;
优点:最简单,开发快,适合简单单跳事实问答;
缺点:固定单向流水线;没有查询改写;不做结果校验;容易召回噪声,复杂多跳问题效果差;存在“迷失中间”问题;
适用场景:简单FAQ、小规模知识库Demo原型。
4.2 高级 RAG(Advanced RAG)
在朴素RAG前后增加预处理、后处理增强环节。
关键技术:
- 查询侧:查询改写、
HyDE假设文档嵌入、多查询生成; - 检索侧:混合检索
BM25关键词 + 向量检索; - 检索后:
Rerank重排序模型,对召回文档二次打分过滤噪声;上下文压缩,精简检索块减少token消耗。
优点:显著提升召回质量,成本增加不大;
缺点:整体依旧是固定流水线,不会自主判断要不要检索,复杂任务无法迭代多次检索;
适用场景:绝大多数企业常规知识库项目。
4.3 模块化 RAG(Modular RAG)
综述重点方案,把整条
RAG流水线拆解成独立可插拔组件:索引模块、预检索模块、检索模块、后检索模块、生成模块、记忆模块,组件之间可以自由替换、编排组合。
创新点:不再是一条写死的直线;可以路由选择不同检索器;支持自省、迭代检索;可接入外部工具;
优点:灵活适配不同业务;可以按需开启关闭模块,便于做消融实验、对比不同策略;方便研究调优;
缺点:架构复杂度上升,组件编排需要工程经验;
代表框架:FlashRAG、ComposeRAG。
4.4 智能体化 RAG(Agentic RAG)
将Agent智能体能力嵌入RAG流水线,由大模型自主做决策:要不要检索、生成什么查询、是否需要多轮检索、什么时候停止检索、对结果做校验反思。
核心能力:任务分解、迭代检索、结果校验反思;可同时调用检索、计算器、搜索引擎等多种工具;Self‑RAG是典型代表,模型输出特殊token控制检索开关;
优点:擅长复杂多跳、需要多轮搜集证据的复杂问题;
缺点:token消耗高,推理延迟大,容易循环反复检索;提示词约束不好会跑偏;
适用场景:深度文档研究、复杂分析类问题。
4.5 图增强 RAG(GraphRAG)
不再只依赖文本块向量相似度,抽取文档中的实体、关系构建知识图谱,利用图结构做检索与多跳推理。
分为三类:
- 知识载体型:图谱作为核心知识库;
- 索引型:图谱只是索引,原始文档依然保留;
- 混合:向量检索+图检索结合使用。
代表实现:微软GraphRAG、LightRAG、HippoRAG、RAPTOR(层级摘要树)
优点:擅长实体关系、多跳关联推理;全局文档综合问答;缓解传统向量检索语义碎片化;
缺点:图谱构建成本高;实体抽取质量直接决定效果;索引构建耗时;
适用场景:人物关系、产业链、医疗、法律等强关系型知识场景。
4.6 各方案对比简表
RAG虽然才出现短短几年,但已经发展出各种各样的RAG方案,NaiveRAG一般也称为传统RAG,是初代检索增强生成方案,也是最早落地、架构最简单的RAG形态。
各类RAG方案对比:
| 方法 | 核心思路 | 强项 | 弱项 | 典型效果 |
|---|---|---|---|---|
| NaiveRAG | 文本相似度检索 | 简单、速度快 | 不具备推理能力,无法识别实体关系 | 综合得分 30–40% |
| RQ-RAG | 问题拆分 / 改写 | 复杂问题召回效果好 | 调用成本高,无法解决实体关系问题 | 效果略优于 NaiveRAG |
| HyDE | 虚拟文档检索 | 短文本问题匹配精度高 | 依赖大模型生成结果,易引入幻觉 | 效果优于 NaiveRAG |
| GraphRAG | 知识图谱 + 社区检索 | 支持多跳推理,全局理解能力强 | 运行慢、Token 开销大、数据更新困难 | 综合得分约 50% |
| Agentic RAG | 智能体自主规划、迭代检索与工具调用 | 自主决策、动态调整检索策略,适配复杂长任务 | 流程链路长、耗时久、逻辑复杂度高 | 综合表现中上,灵活度突出 |
| LightRAG | 双层图检索 + 增量更新 | 高效精准、成本低,支持多模态 | 索引阶段仍依赖大模型 | 综合得分 60–85% |
| LLM Wiki | 摄入时编译结构化百科知识,查询检索整理后的知识页 | 知识全局沉淀、无碎片、可读性极强、适合长期知识库复利 | 预处理编译成本高、实时性差、不适合动态数据 | 回答质量极高,适合企业静态知识库 |
还有很多方案:
| 方法 | 核心思路 | 强项 | 弱项 | 典型效果 |
|---|---|---|---|---|
| Hybrid RAG | 向量+BM25混合检索 | 召回准、兼顾语义与关键词 | 双索引维护成本高 | 工业界首选,稳定 |
| RAPTOR | 分层聚类+多层级检索 | 长文档、多章节问题强 | 建树开销大 | 长文本最佳 |
| Self-RAG | 生成后自我反思重查 | 幻觉低、质量可控 | 多一轮LLM、成本高 | 高可靠问答 |
| CRAG | 检索质量评估+纠错 | 鲁棒性强、防垃圾进 | 逻辑复杂、链路长 | 开放域稳 |
| Adaptive RAG | 问题难度路由策略 | 速度质量平衡、企业首选 | 需训练分类器 | 生产标准 |
| MM-RAG | 图文统一嵌入、跨模态检索 | 能处理PDF/表格/图片 | 依赖多模态模型、贵 | 文档知识库 |
| NodeRAG | 实体级细粒度知识网络 | 复杂关系推理强 | 构建成本高 | 多跳问答强 |
💡工程实践:现实项目很少只用单一范式,经常互相组合,例如:模块化
RAG+Graph检索 +Agent自省。
5. 开源框架/平台
本次筛选标准:项目核心定位以 RAG 为主;区分代码开发SDK与RAG专用服务引擎,排除Dify这类以Agent工作流为核心的通用低代码AI平台。下面按照2026年8月GitHub Star热度依次介绍7个主流项目。
5.1 RAGFlow(⭐ ~88k)
项目地址
RAGFlow是一款面向企业复杂文档场景的开源RAG引擎,依托深度文档理解能力构建完整检索增强工作流。项目附带可视化Web管理界面,同时开放标准化API方便业务系统集成。虽然内置可选Agent模板,但Agent仅作为附加拓展能力,产品全部底层设计围绕知识库检索问答构建,不属于通用Agent开发平台,非常适合国内企业私有化知识库落地。
核心特性:
- 原生深度文档解析,完美支持
PDF、扫描件、Excel表格、图文混排、版式复杂合同文档; - 内置混合检索(关键词+向量检索)、重排序、可控切片策略,支持可视化调整文本分块;
- 答案溯源引用机制,每条结论绑定原始文档片段,降低模型幻觉,结果可审计;
- 支持多样化大模型、嵌入模型灵活接入,开箱即用,无需从零搭建
RAG底层链路; - 提供完整
HTTP API,支持与业务系统深度对接。
适用场景:企业内部知识库、合同文档问答、扫描资料检索、私有化部署业务问答系统。
5.2 LlamaIndex(⭐ ~46k)
项目地址
社区公认的RAG优先开发框架,前身为GPT‑Index。框架设计初衷就是打通私有数据与大语言模型,是面向开发者的代码SDK。虽然支持拓展Agent能力,但Agent仅作为可选插件,核心链路聚焦文档加载、索引构建、检索调度,适合开发者灵活定制各类RAG策略。
核心特性:
- 内置上百种数据源连接器,兼容
PDF、网页、数据库、各类文档格式; - 多索引体系:向量索引、树形摘要索引、属性知识图谱索引,原生支持
GraphRAG开发; - 开箱实现
HyDE、RAG‑Fusion、父文档检索等大量高级RAG优化方案; - 分层
API设计,高层API快速搭建Demo,底层API支持自定义改写检索、预处理逻辑; - 兼容市面上绝大多数向量数据库、大模型、重排模型。
适用场景:自定义RAG业务开发、长文档处理、GraphRAG原型验证、需要灵活迭代检索策略的项目。
5.3 LightRAG(⭐ ~35k)
项目地址
香港大学团队开源的轻量化图增强RAG算法库,专注解决传统向量RAG文本碎片化、多跳推理薄弱的痛点。项目代码精简,无冗余Web界面、无复杂Agent编排模块,专注实现向量检索+知识图谱双层检索架构,MIT宽松协议,方便二次改造与学术验证。
核心特性:
- 双层检索范式:底层向量检索负责细节匹配,上层知识图谱完成实体关联、多跳推理;
- 支持文档增量更新,新增文本自动抽取实体与关系,无需全量重建索引;
- 原生支持重排序模块,可自由切换各类嵌入模型与大模型;
- 架构轻量化,部署资源开销低于传统
GraphRAG方案; - 提供简洁
Python接口,便于嵌入自有业务代码。
适用场景:人物、产业链、医疗、法律等强实体关系知识库,需要多跳问答的RAG系统。
5.4 腾讯 WeKnora(⭐ ~20k)
项目地址
腾讯开源企业级RAG+知识框架,RAG为核心底座,ReAct Agent、Wiki图谱为附加扩展能力;Go语言实现,完整WebUI与企业级API,面向私有化知识库落地。
核心特性:
- 多模态深度文档解析,支持
PDF、图片、合同,兼容飞书、语雀等多源数据导入; - 混合检索:向量+关键词+知识图谱检索,支持父子分块、重排序;
- 企业级能力:
RBAC权限、审计日志、答案溯源、多租户; - 模块化,可对接主流向量库、各类大模型;
- 支持开启
Agent模式处理复杂问题,不强制依赖Agent。
适用场景:国内企业私有化知识库、内部文档问答、业务客服知识库。
5.5 Haystack 2.x(⭐ ~24k)
项目地址
Deepset推出的企业级模块化RAG流水线开发框架,采用全新DAG有向图组件化架构,面向生产环境设计。框架重心围绕检索、文档处理、问答流水线打造,Agent能力仅作为可选拓展,不会侵入RAG核心流程,商业友好Apache2.0协议。
核心特性:
- 强类型组件化流水线,支持分支路由、循环迭代、条件判断,构建复杂动态
RAG链路; - 原生支持混合检索、检索结果重排、上下文压缩等工业常用优化手段;
- 完善调试链路、日志观测能力,方便线上问题定位;
- 深度兼容
Elasticsearch、OpenSearch等企业主流检索引擎; - 组件高度解耦,开发者可以自由替换文档切分、检索、生成模块。
适用场景:正式上线企业级RAG服务,对稳定性、可运维、合规审计有较高要求的项目。
5.6 txtai(⭐ ~13k)
项目地址
一体化轻量级嵌入式RAG Python库,最大特点是内置嵌入、向量存储、语义检索、问答能力,不需要额外部署独立向量数据库。项目主打轻量化语义检索场景,不内置重型Agent工作流,适合嵌入小型程序、本地离线应用。
核心特性:
- 单包依赖极简,向量索引内置,支持稠密向量、稀疏关键词混合检索;
- 同时支持语义检索、
RAG问答、主题建模,API简洁; - 支持导出
REST服务,可快速封装成独立语义问答服务; - 跨平台友好,适配
PC、边缘设备离线运行; - 支持图文、文本多模态向量构建。
适用场景:本地离线知识库、嵌入式程序内置问答、轻量化小型Demo、边缘端RAG应用。
5.7 阿里 PAI‑RAG(⭐ ~ 0.5k)
项目地址
阿里开源Agentic‑RAG企业框架,以RAG流水线为基础,叠加查询改写、ReAct、MCP工具调用;提供WebUI与全套API,适合复杂业务问答。
核心特性:
- 多模态文档解析,内置混合检索、Rerank重排序;
- 原生
Query改写、问题拆解,支持多跳问答; ReAct智能体、MCP工具、Text‑to‑SQL能力;- 兼容通义、开源
LLM、第三方模型; - 完整可观测,支持私有化部署。
适用场景:复杂业务问答、需要工具调用、多跳推理的企业RAG项目。
6. 小结
结合上下文工程视角来看,RAG不是简单的 “向量库+大模型”,而是一套完整的中层系统实现,由底层三大基础组件组装而成。从朴素RAG一路演进到模块化、智能体、图增强RAG,本质就是上下文工程思想不断落地:对检索、处理、记忆做动态编排,构造最优的输入上下文C = A ( c 1 , c 2 , … , c n ) C=\mathcal{A}(c_1,c_2,\dots,c_n)C=A(c1,c2,…,cn),约束在token窗口内最大化任务相关信息。