这里写自定义目录标题
- 欢迎使用Markdown编辑器
- 一、传统 RAG 的"只见树木不见森林"困境
- 二、GraphRAG 的核心机制:先建图,再检索
- 三、评测数据:GraphRAG 到底强在哪里
- 四、GraphRAG 的技术路线选择
- 五、工程落地的关键问题
- 六、适用场景判断:什么情况下值得上 GraphRAG
- 七、总结
- 新的改变
- 功能快捷键
- 合理的创建标题,有助于目录的生成
- 如何改变文本的样式
- 插入链接与图片
- 如何插入一段漂亮的代码片
- 生成一个适合你的列表
- 创建一个表格
- 设定内容居中、居左、居右
- SmartyPants
- 创建一个自定义列表
- 如何创建一个注脚
- 注释也是必不可少的
- KaTeX数学公式
- 新的甘特图功能,丰富你的文章
- UML图表
- 流程图
- FLowchart流程图
- 导出与导入
- 导出
- 导入
欢迎使用Markdown编辑器
你好! 这是你第一次使用# GraphRAG 图检索增强生成:为什么传统 RAG 不够用,以及如何用知识图谱破解复杂推理难题
检索增强生成(RAG)已经成为大模型落地企业知识问答的主流方案,但越来越多团队在实践中撞上了一堵墙:面对简单的事实性问题,RAG 表现优异;一旦涉及跨文档关联、多跳逻辑推理和全局性总结,传统 RAG 就力不从心。根本原因在于传统 RAG 的信息组织方式——把文档切成块、向量化、按相似度召回——天然割裂了信息之间的关联。本文深入剖析传统 RAG 的局限,讲解 GraphRAG 如何通过知识图谱重构检索范式,并给出技术选型和落地的实用建议。
一、传统 RAG 的"只见树木不见森林"困境
传统 RAG 的流水线看起来无懈可击:文档加载、文本分块、向量化、相似度检索、拼接生成。这套流程解决了一个基本问题——让模型能访问私有数据。但深入观察就会发现三个结构性缺陷。
第一,文本分块导致上下文割裂。一篇文档被切成几十个块,每个块是一个孤立的小片段。当答案需要把文档开头的事实和结尾的事实组合起来时,检索系统可能只召回其中一个块,另一个块因为与查询的相似度不够高而落选。信息明明存在,却因为"碎片化存储"而无法被完整利用。
第二,缺乏跨文档关联能力。真实业务中的知识往往是网状结构:供应商和客户的关系、竞品之间的对比、产品线之间的依赖。传统 RAG 的检索单位是"块",块与块之间没有显式关联,模型只能被动接受召回结果,无法主动沿着关系链去探索。要回答"哪些供应商同时服务于我们的两家竞品",传统 RAG 需要多次独立检索再人工拼合,成功率自然不高。
第三,全局性问题无从下手。像"这份技术方案的整体架构是什么""过去一年我们处理了哪些类型的故障"这类需要通览全局的问题,向量检索的"找相似片段"范式完全不匹配——没有哪一段文本能直接回答全局性问题。传统 RAG 只能退化成逐块总结再拼接,质量堪忧。
这三重困境的本质是:知识被存储为孤立的文本块,而问题需要的是关系网络。GraphRAG 正是针对这一点提出的解决方案。
二、GraphRAG 的核心机制:先建图,再检索
GraphRAG 的基本思路分两步:离线阶段对文档构建知识图谱,在线阶段基于图谱进行检索和推理。
离线建图是整个系统的地基。流程是:对文档做实体抽取,识别出人、组织、产品、事件、概念等实体;再抽取实体之间的关系,如"A 是 B 的供应商"“C 于某日发布了 D”;最后把实体作为节点、关系作为边,写入图数据库。这一步的质量直接决定系统的上限——实体抽取不准确,图谱就是一堆噪声;关系抽取不完整,推理链就会断裂。实践上可以先用大模型做抽取,再用规则和人工校对兜底,逐步积累领域图谱。
在线检索与建图同样关键。用户提问后,系统先做查询解析,定位与问题相关的实体;然后以这些实体为起点,在图谱上做多跳遍历,沿着关系边收集相关联的信息;最后把收集到的实体、关系和原文片段一起作为上下文,交给生成模型组织答案。
这个机制带来的能力跃迁是本质性的。面对"公司 X 的哪些合作伙伴与公司 Y 有业务往来"这类问题,传统 RAG 需要碰运气,GraphRAG 则可以在图谱上精确地沿着"合作伙伴→合作公司"的关系边遍历,得到完整且可解释的答案路径。答案不再是"看起来相关"的文本堆砌,而是"有据可查"的关系链。
三、评测数据:GraphRAG 到底强在哪里
公共评测基准的对比数据可以让我们对 GraphRAG 的能力有量化认知。在一项覆盖事实检索、复杂推理、上下文摘要和创意生成四类任务的权威基准测试中,顶尖的 GraphRAG 方案在文学类数据集上的综合成绩明显领先传统方案,在医疗等专业领域优势进一步扩大——事实检索、复杂推理、上下文摘要等多项细分指标均显著高于第二名。
更值得关注的是复杂查询场景的对比:在需要连接多个事实的复杂查询中,GraphRAG 的召回率可稳定在九成以上,而传统向量 RAG 往往不足六成;在复杂推理型任务中,准确率提升约二十个百分点。医疗诊断、金融风控这类对事实准确性"错不起"的行业,恰恰是传统 RAG 的"深水区",也是 GraphRAG 展现核心价值的必争之地。
当然,评测数据反映的是最优实现的上限,不代表开箱即得。GraphRAG 的效果高度依赖图谱质量、实体抽取模型和检索策略,这些都需要结合业务场景做针对性调优。把基准成绩当成"承诺",是很多团队踩坑的开始。
四、GraphRAG 的技术路线选择
当前 GraphRAG 的实现路线大致有三类,各有取舍。
微软的 MS-GraphRAG 是社区影响力最大的开源方案。它以"社区检测 + 社区摘要"为特色:构建图谱后,用社区发现算法把图划分为若干社区,为每个社区生成全局摘要。回答全局性问题时,直接基于社区摘要做综述;回答局部问题时,回到具体实体和关系。这种分层设计兼顾了全局视野与局部精度,但整体管线较重,对算力和存储的要求较高。
HippoRAG 等方案侧重轻量与增量。它们借鉴了认知科学的"海马体索引"思想,用更轻量的方式建立图谱索引,目标是降低构建成本、支持知识库动态更新。对于文档规模快速增长、对实时性有要求的场景,这类方案更务实。
自建图谱路线强调与业务深度融合。在垂直领域,通用的开箱即用方案往往不够贴合业务语义——行业特有的实体类型、关系定义和推理规则,需要结合领域知识定制。自建图谱的成本高,但一旦建成,会成为竞争对手难以复制的数据资产。
选型建议:团队如果以快速验证为主,从成熟开源方案起步;如果有明确的垂直领域语义和长期数据积累计划,认真评估自建路线的长期价值;如果知识库规模不大、以单文档问答为主,传统 RAG 加混合检索可能是更经济的选择——GraphRAG 是为复杂问题设计的,不是万能药。
五、工程落地的关键问题
把 GraphRAG 落到生产环境,有几个容易被低估的工程问题。
第一是图谱质量的生命周期管理。图谱不是建一次就完事,文档更新后实体和关系会变化,需要增量更新机制和一致性校验。图谱中的过期关系比没有关系更有害——它会给出自信而错误的推理路径。
第二是检索与图谱的混合使用。实践经验表明,GraphRAG 和传统向量检索不是替代关系而是互补关系:向量检索擅长语义相似匹配,图谱擅长关系推理。成熟的架构往往是"向量召回初筛 + 图谱推理深化"的组合,先定位相关子图,再在子图内做关系遍历。
第三是可观测与可解释。图检索的推理路径天然可追踪——模型依据哪些实体、沿着哪些关系得出了结论,可以完整回放。要善用这一特性,把推理路径暴露给用户和审计方,这既是 GraphRAG 的差异化优势,也是建立信任的关键。
第四是成本控制。图谱构建依赖大模型做实体抽取和关系抽取,对于海量文档,这是一笔可观的推理成本。要设计好分批处理、缓存复用和质量抽检机制,避免"建一个比用一年还贵"的尴尬。
六、适用场景判断:什么情况下值得上 GraphRAG
判断是否引入 GraphRAG,可以对照三个条件。第一,知识具有明显的网状结构——实体之间的关系比实体本身更重要,比如供应链、组织架构、学术引用、药物相互作用。第二,问题类型以关联分析和多跳推理为主——用户经常问"与 A 相关的有哪些"“这会影响什么”。第三,对答案的可解释性有要求——需要展示推理依据,而不只是结论。
如果三个条件都不满足,比如纯 FAQ 问答、单文档检索,传统 RAG 加上重排序已经足够,强行上 GraphRAG 只会增加复杂度。技术选型的智慧不在于用最前沿的方案,而在于用最匹配的方案解决真实问题。
七、总结
GraphRAG 把 RAG 从"找相似文本"升级为"沿关系推理",用知识图谱补上了传统 RAG 在关联分析、多跳推理和全局理解上的短板。评测数据证实了它在复杂查询场景的显著优势,医疗、金融等严肃行业正在加速采用。但 GraphRAG 不是银弹,它的价值取决于图谱质量、场景匹配和工程投入。对于知识密集型、关系复杂、对可解释性有要求的企业应用,GraphRAG 值得认真评估;对于简单问答场景,扎实做好传统 RAG 的检索链路,依然是投入产出比最高的选择。
Markdown编辑器所展示的欢迎页。如果你想学习如何使用Markdown编辑器, 可以仔细阅读这篇文章,了解一下Markdown的基本语法知识。
新的改变
我们对Markdown编辑器进行了一些功能拓展与语法支持,除了标准的Markdown编辑器功能,我们增加了如下几点新功能,帮助你用它写博客:
- 全新的界面设计,将会带来全新的写作体验;
- 在创作中心设置你喜爱的代码高亮样式,Markdown将代码片显示选择的高亮样式进行展示;
- 增加了图片拖拽功能,你可以将本地的图片直接拖拽到编辑区域直接展示;
- 全新的KaTeX数学公式语法;
- 增加了支持甘特图的mermaid语法1功能;
- 增加了多屏幕编辑Markdown文章功能;
- 增加了焦点写作模式、预览模式、简洁写作模式、左右区域同步滚轮设置等功能,功能按钮位于编辑区域与预览区域中间;
- 增加了检查列表功能。
功能快捷键
撤销:Ctrl/Command+Z
重做:Ctrl/Command+Y
加粗:Ctrl/Command+B
斜体:Ctrl/Command+I
标题:Ctrl/Command+Shift+H
无序列表:Ctrl/Command+Shift+U
有序列表:Ctrl/Command+Shift+O
检查列表:Ctrl/Command+Shift+C
插入代码:Ctrl/Command+Shift+K
插入链接:Ctrl/Command+Shift+L
插入图片:Ctrl/Command+Shift+G
查找:Ctrl/Command+F
替换:Ctrl/Command+G
合理的创建标题,有助于目录的生成
直接输入1次#,并按下space后,将生成1级标题。
输入2次#,并按下space后,将生成2级标题。
以此类推,我们支持6级标题。有助于使用TOC语法后生成一个完美的目录。
如何改变文本的样式
强调文本强调文本
加粗文本加粗文本
标记文本
删除文本
引用文本
H2O is是液体。
210运算结果是 1024.
插入链接与图片
链接: link.
图片:
带尺寸的图片:
居中的图片:
居中并且带尺寸的图片:
当然,我们为了让用户更加便捷,我们增加了图片拖拽功能。
如何插入一段漂亮的代码片
去博客设置页面,选择一款你喜欢的代码片高亮样式,下面展示同样高亮的代码片.
// An highlighted blockvarfoo='bar';生成一个适合你的列表
- 项目
- 项目
- 项目
- 项目
- 项目1
- 项目2
- 项目3
- 计划任务
- 完成任务
创建一个表格
一个简单的表格是这么创建的:
| 项目 | Value |
|---|---|
| 电脑 | $1600 |
| 手机 | $12 |
| 导管 | $1 |
设定内容居中、居左、居右
使用:---------:居中
使用:----------居左
使用----------:居右
| 第一列 | 第二列 | 第三列 |
|---|---|---|
| 第一列文本居中 | 第二列文本居右 | 第三列文本居左 |
SmartyPants
SmartyPants 是一个文本转换工具,主要功能是将普通的 ASCII 标点符号自动转换为更美观的印刷体标点符号。例如:
| 原始符号 | 转换后 | 说明 |
|---|---|---|
"引号" | “引号” | 直引号变弯引号 |
'单引号' | ‘单引号’ | 直单引号变弯单引号 |
-- | – | 两个连字符变短破折号 |
--- | — | 三个连字符变长破折号 |
... | … | 三个点变省略号 |
创建一个自定义列表
- Markdown
- Text-to-HTMLconversion tool Authors
- John
- Luke
如何创建一个注脚
一个具有注脚的文本。2
注释也是必不可少的
Markdown将文本转换为HTML。
KaTeX数学公式
您可以使用渲染LaTeX数学表达式 KaTeX:
Gamma公式展示Γ ( n ) = ( n − 1 ) ! ∀ n ∈ N \Gamma(n) = (n-1)!\quad\forall n\in\mathbb NΓ(n)=(n−1)!∀n∈N是通过欧拉积分
Γ ( z ) = ∫ 0 ∞ t z − 1 e − t d t . \Gamma(z) = \int_0^\infty t^{z-1}e^{-t}dt\,.Γ(z)=∫0∞tz−1e−tdt.
你可以找到更多关于的信息LaTeX数学表达式here.
新的甘特图功能,丰富你的文章
- 关于甘特图语法,参考 这儿,
UML图表
可以使用UML图表进行渲染,例如下面产生的一个序列图:
- 关于UML图表语法,参考 这儿,
流程图
- 关于Mermaid语法,参考 这儿,
FLowchart流程图
我们依旧会支持flowchart.js的流程图语法:
- 关于Flowchart流程图语法,参考 这儿.
导出与导入
导出
如果你想尝试使用此编辑器, 你可以在此篇文章任意编辑。当你完成了一篇文章的写作, 在上方工具栏找到文章导出,生成一个.md文件或者.html文件进行本地保存。
导入
如果你想加载一篇你写过的.md文件,在上方工具栏可以选择导入功能进行对应扩展名的文件导入,
继续你的创作。
mermaid语法说明 ↩︎
注脚的解释 ↩︎