news 2026/10/4 4:36:53

RAG 是 Retrieval-Augmented Generation(检索增强生成) 是什么

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RAG 是 Retrieval-Augmented Generation(检索增强生成) 是什么

一、为什么需要 RAG?

单纯的大模型(如 GPT)有几个天然问题:

  • 知识有截止时间(训练后发生的新信息不知道)

  • 不能直接访问你的私有数据(文档、数据库、公司内部资料)

  • 容易“胡编”(hallucination)

RAG 的目的就是:
用“可控、可更新、可追溯”的外部知识,约束并增强大模型的回答。

二、RAG 的基本工作流程(非常重要)

经典 RAG = 4 个步骤

1️⃣ 文档准备(Indexing)

  • 把资料切成 chunk(例如 500~1000 tokens)

  • 用 Embedding 模型转成向量

  • 存入 向量数据库

常见向量库:

  • FAISS

  • Milvus

  • Pinecone

  • Weaviate

  • OpenSearch / Elasticsearch(向量模式)

2️⃣ 用户提问

“加拿大魁省的 Welcome Tax 是怎么计算的?”

3️⃣ 检索(Retrieval)

把用户问题也转成向量

在向量库里找 语义最相近的文档片段

通常取 Top-k(如 3~10 段)

⚠️ 不是关键词搜索,是语义搜索

4️⃣ 生成(Generation)

把检索结果 + 用户问题,一起喂给 LLM:

【已知资料】

  • 文档1:……
  • 文档2:……

【问题】
……

【请基于以上资料回答】

➡️ 模型只能“照着资料说”,而不是凭空发挥。

三、RAG ≠ 微调(Fine-tuning)

这是一个非常常见的误区:

对比RAG微调
是否改模型参数❌ 不改✅ 改
数据更新✅ 随时更新❌ 重新训练
私有数据✅ 非常适合⚠️ 成本高
幻觉风险低仍可能
成本低高

现实项目中:90% 用 RAG,10% 才需要微调

四、RAG 特别适合什么场景?

结合你的背景,其实你已经“非常适合 RAG”

✅ 典型应用

  • 企业 / 项目文档问答

  • 技术文档(AWS / Angular / Java / Keycloak)

五、一个非常直观的比喻

LLM = 会写作文的学生
RAG = 给他一本开卷考试的资料

不开卷 → 靠记忆 → 容易瞎写
开卷 → 查资料 → 有据可依

六、工程视角:一个最小 RAG 架构

[用户问题]↓[Embedding]↓[VectorDB]——>Top-k 文档 ↓[Prompt 拼接]↓[LLM生成答案]

七、RAG 的进阶玩法(你后面一定会用到)

  • Hybrid Search:向量 + 关键词(BM25)

  • Re-ranking:再用模型重新排序

  • Metadata Filter:按国家 / 时间 / 来源过滤

  • Multi-step RAG:先拆问题再检索

  • Agent + RAG:自动决定查什么

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 8:41:33

5个开源大模型镜像推荐:Qwen3-0.6B免配置一键部署教程

5个开源大模型镜像推荐:Qwen3-0.6B免配置一键部署教程 你是否还在为大模型的复杂部署流程头疼?想快速体验最新一代通义千问模型却卡在环境配置上?本文为你带来一份“开箱即用”的解决方案——5款值得尝试的开源大模型镜像推荐,并…

作者头像 李华
网站建设 2026/10/2 5:00:40

CAM++能否用于实时识别?流式处理可行性测试报告

CAM能否用于实时识别?流式处理可行性测试报告 1. 引言:我们为什么关心CAM的实时能力? 你有没有遇到过这样的场景:需要在电话客服系统中,一边听用户说话,一边判断是不是注册过的老客户?或者在一…

作者头像 李华
网站建设 2026/10/3 20:54:25

微调效率翻倍!Qwen2.5-7B配合ms-swift实测

微调效率翻倍!Qwen2.5-7B配合ms-swift实测 1. 引言:为什么这次微调这么快? 1.1 十分钟完成微调,不是夸张 你有没有经历过一次微调等上几个小时甚至一整天?显存爆了、训练崩了、参数调不明白……这些痛苦几乎每个尝试…

作者头像 李华
网站建设 2026/10/3 11:44:57

DeepSeek-R1-Distill-Qwen-1.5B成本优化:按需GPU计费实战指南

DeepSeek-R1-Distill-Qwen-1.5B成本优化:按需GPU计费实战指南 1. 引言:为什么你需要关注模型部署的成本? 你有没有遇到过这种情况:模型跑起来了,功能也没问题,但一看账单,GPU费用高得吓人&…

作者头像 李华
网站建设 2026/10/3 5:54:05

NewBie-image-Exp0.1数据类型冲突?镜像已修复常见Bug实战说明

NewBie-image-Exp0.1数据类型冲突?镜像已修复常见Bug实战说明 1. 问题背景与镜像价值 你是否在尝试运行 NewBie-image-Exp0.1 时遇到过“浮点数索引”、“维度不匹配”或“数据类型冲突”这类报错?这些是该模型开源初期常见的代码缺陷,尤其…

作者头像 李华
网站建设 2026/10/3 19:42:55

Qwen3-Embedding-4B vs Cohere对比:商业场景性能评测

Qwen3-Embedding-4B vs Cohere对比:商业场景性能评测 1. Qwen3-Embedding-4B 核心能力解析 Qwen3 Embedding 模型系列是 Qwen 家族中专为文本嵌入与排序任务打造的最新力作。该系列基于强大的 Qwen3 密集基础模型,推出了涵盖 0.6B、4B 和 8B 多种参数规…

作者头像 李华