news 2026/8/22 11:47:00

LlamaIndex 系列【2】检索增强生成(Retrieval‑Augmented Generation)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
LlamaIndex 系列【2】检索增强生成(Retrieval‑Augmented Generation)

文章目录

  • 1. 前言
  • 2. 什么是 RAG ?
    • 2.1 基础定义
    • 2.2 三大核心组件
    • 2.3 基础工作流(朴素RAG)
    • 2.4 普通 LLM vs RAG
    • 2.5 典型应用场景
    • 2.6 发展历史
  • 3. 为什么需要 RAG ?
    • 3.1 LLM 底层本质
    • 3.2 LLM 如何学习
    • 3.3 LLM 会产生幻觉
    • 3.4 RAG 如何解决幻觉问题
  • 4. 实现方案
    • 4.1 朴素 RAG(Naive RAG)
    • 4.2 高级 RAG(Advanced RAG)
    • 4.3 模块化 RAG(Modular RAG)
    • 4.4 智能体化 RAG(Agentic RAG)
    • 4.5 图增强 RAG(GraphRAG)
    • 4.6 各方案对比简表
  • 5. 开源框架/平台
    • 5.1 RAGFlow(⭐ ~88k)
    • 5.2 LlamaIndex(⭐ ~46k)
    • 5.3 LightRAG(⭐ ~35k)
    • 5.4 腾讯 WeKnora(⭐ ~20k)
    • 5.5 Haystack 2.x(⭐ ~24k)
    • 5.6 txtai(⭐ ~13k)
    • 5.7 阿里 PAI‑RAG(⭐ ~ 0.5k)
  • 6. 小结

1. 前言

在上一篇中,我们了解了上下文工程Context Engineering)中的:

  • 三大基础组件:上下文检索与生成、上下文处理、上下文管理。
  • 四大系统实现RAG系统、记忆系统、工具集成推理、多智能体系统。

RAG属于中层四大系统实现之一,由底层三大基础组件组合构建而成。它以「上下文检索与生成」为核心,同时复用上下文处理、上下文管理能力,用来实现外部知识注入;RAG作为架构骨架,进一步结合业务需求,可实现知识库问答等上层Agent/AI应用。工程中RAG常与记忆、工具推理组合,共同构建复杂智能体。

基础组件属于底层能力模块,是上下文工程最基础的 “零件库”,提供信息获取、信息加工、信息存储管理的基础能力。四大系统属于中层架构范式,组装基础组件形成标准化架构骨架,是通用技术方案,还不是面向用户的成品。

基于四大系统架构,结合业务需求开发出来,构建面向终端使用的最终应用,也就是Agent/AI应用,比如智能助手、知识库问答、办公Agent、多角色协同机器人等业务产品。


2. 什么是 RAG ?

2.1 基础定义

RAGRetrieval‑Augmented Generation)检索增强生成,是一种将外部知识库检索大模型文本生成相结合的技术范式:不修改大语言模型本身权重,推理阶段先从外部知识库检索相关资料,再把检索得到的上下文交给大模型,由大模型基于检索回来的真实材料生成回答

公式表达:LLM + your data= 大模型 + 你的私有/外部数据

原始大语言模型训练依赖公开互联网数据,企业私有文档、内部业务资料、实时互联网信息,通常不在模型训练数据集中,裸LLM会产生幻觉、无法回答业务专属问题。

在《面向大语言模型的上下文工程综述》的三层架构中:

  • 底层:三大基础组件(上下文检索与生成、上下文处理、上下文管理)
  • 中层:四大系统实现之一 RAG系统
  • 上层:Agent/AI应用(知识库问答、文档助手等产品)

RAG不是底层单一组件,而是一套拼装好的系统架构范式,核心依赖「上下文检索与生成」组件,同时复用上下文处理、上下文管理能力。

简单理解:大模型本身参数里存储的知识叫参数化知识RAG从外部文档库拿到的资料叫非参数化知识,把检索出来的资料组装进上下文C = A ( c 1 , c 2 , … , c n ) C=\mathcal{A}(c_1,c_2,\dots,c_n)C=A(c1,c2,,cn),交给大模型参考再输出答案。

解决痛点

  1. 幻觉问题:让回答引用真实文档证据,减少模型凭空编造内容;
  2. 知识时效性:模型训练完成之后新知识无法写入权重,RAG可以读取实时更新的外部文档;
  3. 领域私有知识:企业内部文档、业务数据不需要微调模型,直接通过检索注入;
  4. 成本可控:相比模型微调,RAG改动知识库即可更新知识,不需要重新训练权重。

我给你精简、干净、可直接放进技术博客 / 面试背诵的 300 字标准版:

2.2 三大核心组件

一套基础的RAG系统由**知识库、检索器、生成器(LLM)**三大核心组件构成。

知识库RAG的数据底座,用于存储权威、真实、最新的外部资料,包括业务文档、手册、合同、私有数据等。原始文档经过解析、清洗、分块、向量化后,存入向量数据库,为检索提供可靠数据源,弥补大模型参数知识有限、过时的缺陷。

检索器负责理解用户问题,根据用户Query从知识库中精准召回相似度最高的文本片段,过滤无关内容,输出高质量参考上下文,为模型提供作答依据。

生成器即 LLM,接收用户问题与检索得到的真实资料,强制基于外部参考内容生成答案,不再依赖模型内部参数脑补。

2.3 基础工作流(朴素RAG)

朴素RAG(Naive‑RAG) 是最基础、最简单版本的检索增强生成,线性直来直去的RAG流水线,没有额外优化模块。

朴素RAG一共4个工作步骤:

  1. 索引阶段:原始文档切分,通过Embedding向量化,向量与文本存入向量数据库,离线完成知识库构建。
  2. 查询阶段:接收用户提问,将问题向量化,在向量库中召回相关文档片段。
  3. 组装上下文:将用户query和检索得到的参考片段,拼装成完整提示词送入LLM
  4. 生成输出:大模型基于检索资料输出最终回答。

朴素RAG属于固定线性流水线,短板明显:缺少查询改写能力,多跳推理表现差;复杂问题场景容易召回无关片段,依旧会产生幻觉。

2.4 普通 LLM vs RAG

普通LLM流程:用户Prompt直接送入大模型,依靠模型参数内训练知识生成回答。缺点是不能使用私有数据、知识过时,容易产生幻觉。

RAG引入检索环节:用户问题交给检索器,从知识库召回相关文档片段,将问题与参考文档拼接为增强提示词再交给LLM,让模型基于外部资料输出答案。

RAG收益显著:可以注入私有业务知识、缓解幻觉;更新知识只需要维护知识库,无需微调大模型,还可以实现答案溯源。但代价是增加检索带来的延迟,提升系统复杂度。

RAG实现职责分离:检索器负责找事实,LLM专注文本生成。

2.5 典型应用场景

RAG核心价值:不改动大模型权重,接入外部私有/实时知识,降低幻觉,支持溯源,下面是工程落地高频场景。

  1. 企业内部知识库问答(最主流)
    对接内部手册、合同、制度、FAQ、运维文档。员工自然语言查询内部资料,不用手动翻文档;支持客服、内部助手。

  2. 智能客服与售后机器人
    把产品手册、故障方案、售后政策存入知识库。用户咨询产品问题,基于真实资料回复,减少幻觉,回答可附带来源。

  3. 文档分析助手(PDF/卷宗/报告)
    法律合同、财报、研究论文、项目卷宗。对长文档做问答、摘要、条款提取,快速定位关键信息。

  4. 垂直行业助手

    • 金融:研报、公告问答;
    • 医疗:院内规范、诊疗手册查询;
    • 政务:政策文件解读。
  5. 实时信息问答
    对接搜索引擎作为知识库,获取大模型训练截止时间之后的新闻、事件,解决知识过时问题。

  6. 开发者助手
    接入私有代码文档、接口文档、内部技术规范,做研发问答、接口解释。

  7. 教育知识库
    课程讲义、题库资料,基于教学资料答疑,减少编造知识点。

RAG不擅长纯创意创作,这类场景直接使用原生LLM即可。


2.6 发展历史

早期RAG仅仅把文档切分成文本块做相似度检索;2026年的RAG已经演进为动态上下文编排系统,与上下文工程整套思想完全对齐。

行业普遍认为超大长上下文与RAG属于互补:RAG负责从海量外部资料做粗筛选,长上下文负责局部文档精读。

RAG演进可以划分为5个阶段,下面整理关键里程碑事件:

时间里程碑核心意义
2020Meta NeurIPS 2020正式提出RAG范式;DPR稠密检索论文发表RAG范式正式诞生,确立稠密检索+生成器的基础架构,区分参数化/非参数化知识
2021‑2022REALM、RETRO、WebGPT预训练阶段融合检索;验证大规模检索增强可行性;检索增强走向工业界原型
2023ChatGPT爆发;Advanced RAG普及;LangChain、LlamaIndex生态爆发企业大量落地RAG,朴素RAG暴露出短板;查询改写、重排序、混合检索等高级技术大规模使用
2024‑2025Modular RAG模块化RAG、GraphRAG图增强RAG、Agentic‑RAG智能体RAGRAG从静态流水线走向动态可编排架构;知识图谱、智能体规划融入RAG系统,也是《上下文工程综述》重点论述的方向
2026RAG进入上下文引擎时代,工业化落地与前沿研究并行
1. Agentic‑RAG从科研走向生产;混合检索、重排序成为工业系统默认标配
2. 多模态RAG、记忆‑RAG深度融合;轻量化GraphRAG实现大量开源
3. MCP等标准化协议兴起,检索成为Agent可插拔组件
4. TREC‑RAG、MTRAG多轮RAG等评测基准大量出现
5. 行业形成共识:超大上下文窗口不会取代RAG,二者协同;上下文工程成为RAG顶层设计思想
RAG不再简单等同于“检索+拼接提示词”,升级为动态上下文编排系统;将检索、记忆、工具调用统一纳入上下文工程框架,重点关注系统可靠性、复杂业务工程落地

💡小提示:上下文工程综述论文是20257月发布,2026是该思想大规模落地RAGAgent的产业年份。


3. 为什么需要 RAG ?

3.1 LLM 底层本质

底层本质:高级自动补全

大语言模型的底层本质,是一套概率式自动续写系统。它并不会真正“理解”语义,而是依托前文内容,反复推算后续词元的出现概率,一步步产出整篇文本。

Token生成完整流程:

  1. 上下文接收处理:把用户提问、已经生成的内容合并,整理成模型可识别的输入状态。
  2. 概率分布计算:神经网络利用训练习得的海量语言规律,为词库中每一个候选Token算出对应的发生概率。
  3. 采样选出下一词元:基于概率分布做采样,挑选出本次输出的Token,并非永远选取概率最高项。
  4. 迭代循环输出:将新生成Token拼接到原有上下文末尾,重新走整套流程,直到命中停止条件,生成结束。

举例,输入句子:

今天天气真好,太阳正

基于概率,模型可以生成多个通顺合理的续写:

高高挂在天上 暖洋洋地照耀大地

3.2 LLM 如何学习

LLM学习分为两大核心阶段:

  • 预训练Pre‑training) :海量文本的自学阶段(造脑),产出Base基座模型。
  • 后训练Post‑Training):预训练完成之后,在基座模型权重基础上,开展的全部微调与对齐工作统称后训练

预训练阶段,模型初始参数随机,只会输出乱码。以海量无标注文本为原料,核心任务是预测下一个 Token:输入上文,模型预测后续文本,对比真实结果计算误差,通过反向传播迭代调整参数,习得语法、常识、逻辑,产出** Base基座模型**。基座擅长文本续写,但不会听从人类指令。

后训练(Post‑Training)在基座之上做对齐。先通过SFT监督微调,用指令‑回答样本,教会模型理解并响应指令。再做偏好对齐,可采用RLHFDPO,基于好坏回答数据优化输出质量,叠加安全、工具调用训练,得到可直接对话的Chat模型。

推理阶段权重完全冻结,仅循环预测Token生成回复,不会让模型实时学习。


3.3 LLM 会产生幻觉

LLM本质是生成概率上通顺的词序列,学习训练数据中的统计模式,并不以输出客观事实为优化目标。这里有一个关键认知:Truthful ≠ probable(真实不等于概率高)。文本读起来流畅合理,只代表该文本组合在统计上概率更高,不代表内容属实

当出现知识缺口,比如训练数据缺失、信息过时,模型缺少对应事实依据。但为了完成续写,它会依靠统计规律脑补内容,于是产生幻觉:语气笃定地编造不存在的人名、文献、数据与事件。模型没有真实认知,只是不断预测下一个Token

幻觉无法彻底根除,只能缓解。落地业务时,切忌直接采信大模型给出的事实、数据,一定要做校验。

常用手段包括:

  • RAG检索增强,引入外部可信资料;
  • 优化提示词,鼓励模型坦诚说不知道;
  • 事实类输出必须人工复核。

幻觉并非程序Bug,是大语言模型与生俱来的特性,根源来自模型的生成逻辑。


3.4 RAG 如何解决幻觉问题

RAG(检索增强生成)是解决幻觉最有效的落地方案。

核心思想不让模型靠参数脑补知识,强制依靠外部真实素材作答

通过外接实时、可信数据,大幅降低模型编造概率,有效解决知识过时、事实错误、幻觉虚构等问题。

核心思路:不让模型只靠内部参数记忆知识,外部拉取真实参考资料作为上下文,降低幻觉。


4. 实现方案

按照上下文工程综述的分类,RAG分为:朴素RAG、高级RAG、模块化RAG、智能体化RAG、图增强RAGGraphRAG),另外还有RAPTORSelf‑RAG等代表性变体方案。

4.1 朴素 RAG(Naive RAG)

流程:用户Query→ 向量相似度检索 → 拼接片段 →LLM生成;

优点:最简单,开发快,适合简单单跳事实问答;

缺点:固定单向流水线;没有查询改写;不做结果校验;容易召回噪声,复杂多跳问题效果差;存在“迷失中间”问题;

适用场景:简单FAQ、小规模知识库Demo原型。

4.2 高级 RAG(Advanced RAG)

在朴素RAG前后增加预处理、后处理增强环节。

关键技术:

  1. 查询侧:查询改写、HyDE假设文档嵌入、多查询生成;
  2. 检索侧:混合检索BM25关键词 + 向量检索;
  3. 检索后Rerank重排序模型,对召回文档二次打分过滤噪声;上下文压缩,精简检索块减少token消耗。

优点:显著提升召回质量,成本增加不大;

缺点:整体依旧是固定流水线,不会自主判断要不要检索,复杂任务无法迭代多次检索;

适用场景:绝大多数企业常规知识库项目。

4.3 模块化 RAG(Modular RAG)

综述重点方案,把整条RAG流水线拆解成独立可插拔组件:索引模块、预检索模块、检索模块、后检索模块、生成模块、记忆模块,组件之间可以自由替换、编排组合。

创新点:不再是一条写死的直线;可以路由选择不同检索器;支持自省、迭代检索;可接入外部工具;

优点:灵活适配不同业务;可以按需开启关闭模块,便于做消融实验、对比不同策略;方便研究调优;

缺点:架构复杂度上升,组件编排需要工程经验;

代表框架FlashRAGComposeRAG

4.4 智能体化 RAG(Agentic RAG)

Agent智能体能力嵌入RAG流水线,由大模型自主做决策:要不要检索、生成什么查询、是否需要多轮检索、什么时候停止检索、对结果做校验反思。

核心能力:任务分解、迭代检索、结果校验反思;可同时调用检索、计算器、搜索引擎等多种工具;Self‑RAG是典型代表,模型输出特殊token控制检索开关;

优点:擅长复杂多跳、需要多轮搜集证据的复杂问题;

缺点:token消耗高,推理延迟大,容易循环反复检索;提示词约束不好会跑偏;

适用场景:深度文档研究、复杂分析类问题。

4.5 图增强 RAG(GraphRAG)

不再只依赖文本块向量相似度,抽取文档中的实体、关系构建知识图谱,利用图结构做检索与多跳推理。

分为三类:

  1. 知识载体型:图谱作为核心知识库;
  2. 索引型:图谱只是索引,原始文档依然保留;
  3. 混合:向量检索+图检索结合使用。

代表实现:微软GraphRAGLightRAGHippoRAGRAPTOR(层级摘要树)

优点:擅长实体关系、多跳关联推理;全局文档综合问答;缓解传统向量检索语义碎片化;

缺点:图谱构建成本高;实体抽取质量直接决定效果;索引构建耗时;

适用场景:人物关系、产业链、医疗、法律等强关系型知识场景。

4.6 各方案对比简表

RAG虽然才出现短短几年,但已经发展出各种各样的RAG方案,NaiveRAG一般也称为传统RAG,是初代检索增强生成方案,也是最早落地、架构最简单的RAG形态。

各类RAG方案对比:

方法核心思路强项弱项典型效果
NaiveRAG文本相似度检索简单、速度快不具备推理能力,无法识别实体关系综合得分 30–40%
RQ-RAG问题拆分 / 改写复杂问题召回效果好调用成本高,无法解决实体关系问题效果略优于 NaiveRAG
HyDE虚拟文档检索短文本问题匹配精度高依赖大模型生成结果,易引入幻觉效果优于 NaiveRAG
GraphRAG知识图谱 + 社区检索支持多跳推理,全局理解能力强运行慢、Token 开销大、数据更新困难综合得分约 50%
Agentic RAG智能体自主规划、迭代检索与工具调用自主决策、动态调整检索策略,适配复杂长任务流程链路长、耗时久、逻辑复杂度高综合表现中上,灵活度突出
LightRAG双层图检索 + 增量更新高效精准、成本低,支持多模态索引阶段仍依赖大模型综合得分 60–85%
LLM Wiki摄入时编译结构化百科知识,查询检索整理后的知识页知识全局沉淀、无碎片、可读性极强、适合长期知识库复利预处理编译成本高、实时性差、不适合动态数据回答质量极高,适合企业静态知识库

还有很多方案:

方法核心思路强项弱项典型效果
Hybrid RAG向量+BM25混合检索召回准、兼顾语义与关键词双索引维护成本高工业界首选,稳定
RAPTOR分层聚类+多层级检索长文档、多章节问题强建树开销大长文本最佳
Self-RAG生成后自我反思重查幻觉低、质量可控多一轮LLM、成本高高可靠问答
CRAG检索质量评估+纠错鲁棒性强、防垃圾进逻辑复杂、链路长开放域稳
Adaptive RAG问题难度路由策略速度质量平衡、企业首选需训练分类器生产标准
MM-RAG图文统一嵌入、跨模态检索能处理PDF/表格/图片依赖多模态模型、贵文档知识库
NodeRAG实体级细粒度知识网络复杂关系推理强构建成本高多跳问答强

💡工程实践:现实项目很少只用单一范式,经常互相组合,例如:模块化RAG+Graph检索 +Agent自省。


5. 开源框架/平台

本次筛选标准:项目核心定位以 RAG 为主;区分代码开发SDKRAG专用服务引擎,排除Dify这类以Agent工作流为核心的通用低代码AI平台。下面按照20268GitHub Star热度依次介绍7个主流项目。

5.1 RAGFlow(⭐ ~88k)

项目地址

RAGFlow是一款面向企业复杂文档场景的开源RAG引擎,依托深度文档理解能力构建完整检索增强工作流。项目附带可视化Web管理界面,同时开放标准化API方便业务系统集成。虽然内置可选Agent模板,但Agent仅作为附加拓展能力,产品全部底层设计围绕知识库检索问答构建,不属于通用Agent开发平台,非常适合国内企业私有化知识库落地。

核心特性

  1. 原生深度文档解析,完美支持PDF、扫描件、Excel表格、图文混排、版式复杂合同文档;
  2. 内置混合检索(关键词+向量检索)、重排序、可控切片策略,支持可视化调整文本分块;
  3. 答案溯源引用机制,每条结论绑定原始文档片段,降低模型幻觉,结果可审计;
  4. 支持多样化大模型、嵌入模型灵活接入,开箱即用,无需从零搭建RAG底层链路;
  5. 提供完整HTTP API,支持与业务系统深度对接。

适用场景:企业内部知识库、合同文档问答、扫描资料检索、私有化部署业务问答系统。

5.2 LlamaIndex(⭐ ~46k)

项目地址

社区公认的RAG优先开发框架,前身为GPT‑Index。框架设计初衷就是打通私有数据与大语言模型,是面向开发者的代码SDK。虽然支持拓展Agent能力,但Agent仅作为可选插件,核心链路聚焦文档加载、索引构建、检索调度,适合开发者灵活定制各类RAG策略。

核心特性

  1. 内置上百种数据源连接器,兼容PDF、网页、数据库、各类文档格式;
  2. 多索引体系:向量索引、树形摘要索引、属性知识图谱索引,原生支持GraphRAG开发;
  3. 开箱实现HyDERAG‑Fusion、父文档检索等大量高级RAG优化方案;
  4. 分层API设计,高层API快速搭建Demo,底层API支持自定义改写检索、预处理逻辑;
  5. 兼容市面上绝大多数向量数据库、大模型、重排模型。

适用场景:自定义RAG业务开发、长文档处理、GraphRAG原型验证、需要灵活迭代检索策略的项目。

5.3 LightRAG(⭐ ~35k)

项目地址

香港大学团队开源的轻量化图增强RAG算法库,专注解决传统向量RAG文本碎片化、多跳推理薄弱的痛点。项目代码精简,无冗余Web界面、无复杂Agent编排模块,专注实现向量检索+知识图谱双层检索架构,MIT宽松协议,方便二次改造与学术验证。

核心特性

  1. 双层检索范式:底层向量检索负责细节匹配,上层知识图谱完成实体关联、多跳推理;
  2. 支持文档增量更新,新增文本自动抽取实体与关系,无需全量重建索引;
  3. 原生支持重排序模块,可自由切换各类嵌入模型与大模型;
  4. 架构轻量化,部署资源开销低于传统GraphRAG方案;
  5. 提供简洁Python接口,便于嵌入自有业务代码。

适用场景:人物、产业链、医疗、法律等强实体关系知识库,需要多跳问答的RAG系统。

5.4 腾讯 WeKnora(⭐ ~20k)

项目地址

腾讯开源企业级RAG+知识框架,RAG为核心底座ReAct AgentWiki图谱为附加扩展能力;Go语言实现,完整WebUI与企业级API,面向私有化知识库落地。

核心特性

  1. 多模态深度文档解析,支持PDF、图片、合同,兼容飞书、语雀等多源数据导入;
  2. 混合检索:向量+关键词+知识图谱检索,支持父子分块、重排序;
  3. 企业级能力:RBAC权限、审计日志、答案溯源、多租户;
  4. 模块化,可对接主流向量库、各类大模型;
  5. 支持开启Agent模式处理复杂问题,不强制依赖Agent

适用场景:国内企业私有化知识库、内部文档问答、业务客服知识库。

5.5 Haystack 2.x(⭐ ~24k)

项目地址

Deepset推出的企业级模块化RAG流水线开发框架,采用全新DAG有向图组件化架构,面向生产环境设计。框架重心围绕检索、文档处理、问答流水线打造,Agent能力仅作为可选拓展,不会侵入RAG核心流程,商业友好Apache2.0协议。

核心特性

  1. 强类型组件化流水线,支持分支路由、循环迭代、条件判断,构建复杂动态RAG链路;
  2. 原生支持混合检索、检索结果重排、上下文压缩等工业常用优化手段;
  3. 完善调试链路、日志观测能力,方便线上问题定位;
  4. 深度兼容ElasticsearchOpenSearch等企业主流检索引擎;
  5. 组件高度解耦,开发者可以自由替换文档切分、检索、生成模块。

适用场景:正式上线企业级RAG服务,对稳定性、可运维、合规审计有较高要求的项目。

5.6 txtai(⭐ ~13k)

项目地址

一体化轻量级嵌入式RAG Python库,最大特点是内置嵌入、向量存储、语义检索、问答能力,不需要额外部署独立向量数据库。项目主打轻量化语义检索场景,不内置重型Agent工作流,适合嵌入小型程序、本地离线应用。

核心特性

  1. 单包依赖极简,向量索引内置,支持稠密向量、稀疏关键词混合检索;
  2. 同时支持语义检索、RAG问答、主题建模,API简洁;
  3. 支持导出REST服务,可快速封装成独立语义问答服务;
  4. 跨平台友好,适配PC、边缘设备离线运行;
  5. 支持图文、文本多模态向量构建。

适用场景:本地离线知识库、嵌入式程序内置问答、轻量化小型Demo、边缘端RAG应用。


5.7 阿里 PAI‑RAG(⭐ ~ 0.5k)

项目地址

阿里开源Agentic‑RAG企业框架,以RAG流水线为基础,叠加查询改写、ReActMCP工具调用;提供WebUI与全套API,适合复杂业务问答。

核心特性

  1. 多模态文档解析,内置混合检索、Rerank重排序;
  2. 原生Query改写、问题拆解,支持多跳问答;
  3. ReAct智能体、MCP工具、Text‑to‑SQL能力;
  4. 兼容通义、开源LLM、第三方模型;
  5. 完整可观测,支持私有化部署。

适用场景:复杂业务问答、需要工具调用、多跳推理的企业RAG项目。

6. 小结

结合上下文工程视角来看,RAG不是简单的 “向量库+大模型”,而是一套完整的中层系统实现,由底层三大基础组件组装而成。从朴素RAG一路演进到模块化、智能体、图增强RAG,本质就是上下文工程思想不断落地:对检索、处理、记忆做动态编排,构造最优的输入上下文C = A ( c 1 , c 2 , … , c n ) C=\mathcal{A}(c_1,c_2,\dots,c_n)C=A(c1,c2,,cn),约束在token窗口内最大化任务相关信息。


版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/22 11:46:14

时间序列分析实战:从ARIMA到LSTM的预测建模全流程解析

1. 从“预测明天”说起:时间序列分析到底是什么? 我们每天都在做预测。比如,早上出门前看一眼天气预报,决定要不要带伞;或者根据过去几天的交通状况,预估今天上班需要提前多久出门。这些行为,本…

作者头像 李华
网站建设 2026/8/22 11:46:09

构建抗单点故障与增强数字主权的微服务架构实战

最近在技术社区和行业会议中,关于“数字主权”和“单点故障”的讨论热度持续攀升。这不仅仅是企业架构师或CTO们关心的话题,对于每一位开发者而言,理解其背后的技术内涵和工程实践意义,都至关重要。当我们的应用越来越依赖少数几个…

作者头像 李华
网站建设 2026/8/22 11:45:29

5 行代码让数据自动流动:QtNodes 节点编辑器上手笔记

5 行代码让数据自动流动:QtNodes 节点编辑器上手笔记 【免费下载链接】nodeeditor Qt Node Editor. Dataflow programming framework 项目地址: https://gitcode.com/gh_mirrors/no/nodeeditor 你在画布上右键点出第一个节点,拖一条线连到运算框&…

作者头像 李华
网站建设 2026/8/22 11:44:38

LlamaIndex 系列【3】上下文增强驱动的 LLM 应用开发框架

文章目录1. 前置了解1.1 什么是智能体(Agents)?1.2 什么是工作流(Workflows)?1.3 什么是上下文增强(Context Augmentation)?2. LlamaIndex(原 Run Llama, Inc…

作者头像 李华
网站建设 2026/8/22 11:44:21

机器人任务规划框架:构建稳定自动化工作流的核心技术与实践

这次我们来看一个很有意思的项目——“机器人也想有‘编制’”。这个标题听起来有点调侃,但背后其实是一个关于机器人任务规划与执行框架的技术探索。简单来说,它不是一个具体的硬件机器人,而是一个软件系统或算法框架,旨在让机器…

作者头像 李华