1. 从零理解知识管理 Skill 的底层逻辑
1.1 为什么是 Skill 而不是又一个笔记软件
过去几年,知识管理工具换了一茬又一茬,从双链笔记到白板协作,从标签体系到目录树,大多数人折腾一圈下来发现:工具越换越勤,知识却越存越乱。问题不在于工具不够多,而在于知识管理的核心动作——采集、整理、关联、调用——始终依赖人的自觉性。你不动手,系统就是死的。
Skill 这个概念之所以值得单独拿出来讲,是因为它把知识管理从“人驱动工具”变成了“意图驱动系统”。一个 Skill 本质上是一段封装好的能力单元:你告诉它要做什么,它自己知道该调用哪些资源、走什么流程、产出什么结果。这跟传统笔记软件里“建文件夹、打标签、写双链”的手工活完全是两个维度的东西。
我自己的体会是,当你手里攒了 50 个知识管理 Skill,你实际上拥有的不是 50 个工具,而是一套可编排的生产力流水线。每个 Skill 负责一个具体环节,Skill 之间可以串联、可以并行、可以条件触发。你不再需要记住“这个知识点该放哪个文件夹”,你只需要说“帮我把这份材料消化掉”,后面的拆解、归类、关联、摘要、索引全部自动完成。
1.2 知识管理 Skill 到底解决什么问题
先把这个概念拆开看。知识管理这件事,拆到最细,无非是五个动作:
- 采集:把外部信息抓进来,不管是网页、PDF、聊天记录还是语音
- 清洗:去掉噪音,提取正文,识别结构,统一格式
- 拆解:把大块内容切成可独立引用的知识单元
- 关联:找到知识单元之间的关系,建立索引和语义层
- 调用:在需要的时候,用自然语言把相关知识精准拉出来
传统做法里,这五步全靠人肉。一个熟练的知识管理者,一天能处理 20 篇材料就算高产。而 Skill 化的思路是:每一步都封装成独立能力,用 Agent 做调度器,按需组合。你丢进去 200 篇材料,系统自己跑完五步,你只需要在最后做质量抽检。
这里有个关键认知:Skill 不是替代你思考,而是替代你操作。判断哪些知识有价值、哪些关联有意义、哪些结论可信,这些仍然需要人的判断力。但“把 PDF 转成 Markdown”“把长文切成 500 字以内的语义块”“给每个块生成三个维度的标签”——这些纯操作层面的活,完全可以交给 Skill。
1.3 50 个 Skill 的分层架构思路
50 个 Skill 不是拍脑袋凑数,而是按照知识管理的完整链路分层设计的。我把它分成五层,每层 10 个左右:
| 层级 | 职责 | 典型 Skill 举例 |
|---|---|---|
| 采集层 | 把外部信息拉进来 | 网页正文提取、PDF 解析、语音转写、截图 OCR |
| 清洗层 | 去噪、归一化、结构化 | 广告过滤、正文识别、表格还原、代码块提取 |
| 拆解层 | 切成可独立引用的单元 | 语义分段、论点提取、数据点抽取、引用识别 |
| 关联层 | 建立知识之间的连接 | 实体识别、概念对齐、语义相似度、知识图谱构建 |
| 调用层 | 按需检索和生成 | 语义搜索、摘要生成、问答、报告组装 |
这个分层的好处是:每一层可以独立迭代。你今天换一个更好的 PDF 解析 Skill,不影响上层的拆解和关联逻辑。你明天想加一个“专利文献专用拆解 Skill”,只需要在拆解层挂上去就行。整个系统是可插拔的,不是铁板一块。
注意:分层不是绝对的。有些 Skill 天然跨层,比如“本体建模 Skill”既涉及关联层的概念对齐,也涉及调用层的语义检索。关键是理解每个 Skill 的核心职责,而不是死守分层边界。
2. 核心 Skill 的拆解与实操要点
2.1 采集层:把信息从各种容器里解放出来
采集层的核心挑战是格式多样性。你面对的材料可能是网页、PDF、Word、PPT、Excel、图片、音频、视频、聊天记录、邮件,每一种格式的解析逻辑都不一样。如果采集层做不好,后面所有环节都是垃圾进垃圾出。
我实测下来,采集层最值得投入的 Skill 有这么几个:
网页正文提取 Skill。这个看起来简单,实际上坑最多。很多网页的正文被广告、导航、推荐位、评论区包裹,直接抓 HTML 拿到的是一团噪音。好的提取 Skill 会做三件事:先用 DOM 结构分析找到正文容器,再用文本密度算法过滤掉低密度区域,最后用启发式规则保留标题、作者、发布时间等元数据。我试过七八个方案,最终稳定用的是基于 Readability 算法改进的版本,配合自定义规则处理特定站点。
PDF 解析 Skill。PDF 分两种:文本型和扫描型。文本型直接用解析库提取,扫描型必须先走 OCR。这里有个经验:不要指望一个 Skill 通吃所有 PDF。学术论文、技术手册、扫描合同、PPT 导出稿,这四类 PDF 的结构差异极大,最好分别配置不同的解析策略。学术论文要保留章节结构和引用编号,技术手册要保留代码块和表格,扫描合同要保证 OCR 准确率,PPT 导出稿要处理多栏布局。
语音转写 Skill。会议录音、访谈记录、课程音频,这些材料的价值密度不均匀,但往往包含最鲜活的思考。转写 Skill 的关键参数是分段策略和说话人分离。分段太粗,后续拆解困难;分段太细,语义断裂。我的经验是:按静音间隔切分,最小段 15 秒,最大段 90 秒,配合说话人分离,转写准确率能到 95% 以上。
截图 OCR Skill。这个场景很具体:你在手机上看到一段好内容,截图保存,但截图是图片,搜不到、引不了、改不了。OCR Skill 把它转成文本,顺便识别出代码块、表格、公式等特殊结构。实测下来,通用 OCR 对代码和公式的识别率堪忧,最好单独配置代码识别和公式识别子 Skill。
2.2 清洗层:把脏数据变成干净的知识原料
采集回来的材料,直接拆解会出大问题。清洗层的任务就是去噪、归一化、结构化。这一步做得好不好,直接决定后续关联和调用的质量。
广告和导航过滤 Skill。网页材料里最常见的噪音是广告、导航栏、页脚、相关推荐。这些内容的特征是:文本短、重复率高、位置固定。过滤策略可以很简单:维护一个常见噪音模式库,匹配到的直接删。但要注意,有些技术博客的“相关推荐”里确实有有价值的内容,一刀切会误伤。我的做法是:先标记,不直接删,在拆解层根据上下文决定是否保留。
正文结构还原 Skill。很多材料在采集时丢失了结构信息,标题变成普通段落,列表变成连续文本,表格变成乱序文字。这个 Skill 的任务是从纯文本里恢复结构。它靠的是模式识别:短行且无标点结尾的,大概率是标题;以数字或符号开头的连续行,大概率是列表;包含多个制表符或对齐空格的,大概率是表格。实测下来,这个 Skill 对技术文档的还原准确率能到 85%,对散文类材料效果一般。
代码块提取 Skill。技术材料里的代码块是特殊知识单元,需要单独处理。这个 Skill 要做的:识别代码边界、判断编程语言、保留缩进和注释、标记代码用途。我踩过的坑是:有些材料用行内代码格式写多行代码,有些用引用块包裹代码,有些干脆没有格式标记。解决方案是组合判断:看缩进模式、看关键字密度、看符号分布。
表格还原 Skill。表格是知识管理里最容易被忽视的结构。很多材料里的表格在采集后变成了一堆乱序文字,完全失去价值。这个 Skill 要做的:识别表格边界、还原行列关系、处理合并单元格、保留表头。对于复杂表格,我的建议是:不要强求完美还原,先保证数据不丢,结构信息可以在关联层用元数据补充。
2.3 拆解层:把大块知识切成可独立引用的单元
拆解层是整个知识管理系统的心脏。拆得好,后续关联和调用事半功倍;拆得不好,知识单元要么太大没法精准引用,要么太小失去上下文。
语义分段 Skill。这是最核心的拆解 Skill。它的任务是把长文本切成语义完整的段落。关键参数是目标段长和语义完整性阈值。目标段长建议 300-800 字,太短则上下文不足,太长则检索精度下降。语义完整性靠的是句子间的语义相似度:相邻句子相似度高就合并,相似度低就切分。我实测下来,这个策略对说明文和议论文效果最好,对叙事文需要调低阈值。
论点提取 Skill。很多材料的核心价值在于几个关键论点,其余都是论证和举例。这个 Skill 的任务是识别并提取核心论点。它靠的是论证结构分析:找论点标志词(“因此”“总之”“关键在于”)、找结论句、找重复出现的核心概念。提取出来的论点单独成块,论证和举例作为附属块关联到论点上。
数据点抽取 Skill。材料里的数字、日期、比例、金额、指标,这些是结构化知识的精华。这个 Skill 要做的:识别数据点、提取数值和单位、关联上下文、标注数据来源。我踩过的坑是:同一个数据在不同材料里单位不同、口径不同、时间不同,直接合并会出错。解决方案是:数据点抽取时保留原始上下文,在关联层再做对齐。
引用识别 Skill。学术材料和技术文档里大量存在引用关系:“参见某某文献”“根据某某标准”“引用某某研究”。这个 Skill 的任务是识别引用标记并提取引用信息。它要处理多种引用格式:数字编号、作者年份、脚注尾注、超链接。提取出来的引用信息进入关联层,用于构建知识之间的引用网络。
2.4 关联层:让知识之间产生化学反应
关联层是知识管理系统从“仓库”变成“网络”的关键。没有关联,知识就是孤岛;有了关联,知识才能被组合、被推理、被创造。
实体识别 Skill。从知识单元里识别出人名、机构名、产品名、技术名、地点、时间等实体。这个 Skill 的准确率直接影响后续所有关联的质量。我的经验是:通用实体识别模型对通用领域够用,但对垂直领域(比如专利、医学、法律)必须微调。微调的数据不用多,每个实体类型 200 个标注样本就能显著提升。
概念对齐 Skill。同一个概念在不同材料里可能有不同表述:“AI Agent”“智能体”“代理”“Agent”——这些指的是同一个东西。这个 Skill 的任务是把不同表述对齐到同一个概念节点。它靠的是:同义词词典、上下文相似度、共现模式。我实测下来,纯靠模型对齐准确率约 70%,加上人工维护的同义词表能到 90% 以上。
语义相似度 Skill。计算两个知识单元之间的语义距离,用于推荐相关知识和去重。关键参数是相似度阈值:太高则漏掉关联,太低则引入噪音。我的建议是:分层设置阈值,强关联用 0.85,弱关联用 0.65,中间地带人工抽检。
知识图谱构建 Skill。把实体、概念、知识单元、引用关系组织成图结构。节点是知识单元和实体,边是各种关系(引用、相似、属于、导致、对比)。这个 Skill 的产出是后续语义检索和推理的基础。我踩过的坑是:图谱太密则查询慢,太疏则查不到。解决方案是:分层建图,核心概念建稠密图,边缘概念建稀疏图。
2.5 调用层:在需要的时候精准拉出知识
调用层是用户直接感知的层面。前面四层做得再好,如果调用层拉不出东西,整个系统就是失败的。
语义搜索 Skill。用户用自然语言提问,系统返回最相关的知识单元。关键参数是召回数量和重排策略。我的经验是:先召回 50 个候选,再用交叉编码器重排到前 10 个,最后用规则过滤掉低质量结果。这个流程比单纯向量搜索准确率高 30% 以上。
摘要生成 Skill。把多个知识单元组合成一段连贯的摘要。关键参数是摘要长度和信息密度。我的建议是:摘要长度控制在原文的 10%-20%,信息密度靠“每句话必须包含一个事实或观点”来保证。
问答 Skill。用户提问,系统从知识库里找答案并生成回答。这个 Skill 的难点是幻觉控制:模型容易编造知识库里没有的内容。解决方案是:强制引用来源,每个回答必须附带原文片段;设置置信度阈值,低于阈值的回答标注“不确定”。
报告组装 Skill。根据用户需求,从知识库里拉取相关内容,组装成结构化报告。这个 Skill 的关键是模板管理和内容填充。模板定义报告结构,内容填充从知识库里按位置匹配。我实测下来,这个 Skill 对周期性报告(周报、月报、竞品分析)效率提升最明显。
3. 从零搭建 AI 生产力系统的完整流程
3.1 环境准备与基础配置
搭建这套系统,你不需要顶配硬件,但需要合理的软件架构。我的建议是:
运行环境。本地部署和云端部署各有优劣。本地部署数据安全可控,但算力有限;云端部署算力充足,但数据要出本地。我的做法是:采集层和清洗层本地跑,拆解层和关联层云端跑,调用层按需选择。这样平衡了安全和效率。
模型选型。不是所有 Skill 都需要大模型。采集层的解析、清洗层的过滤、拆解层的分段,这些用规则和小模型就能搞定。真正需要大模型的是:实体识别、概念对齐、摘要生成、问答。我的配置是:小模型做粗筛,大模型做精排,规则做兜底。
存储方案。知识单元用向量数据库存储,实体和关系用图数据库存储,原始材料用对象存储。三者之间用统一 ID 关联。我踩过的坑是:一开始全用关系数据库,结果向量搜索慢得没法用。后来改成混合存储,性能提升 10 倍以上。
调度框架。50 个 Skill 需要一个调度器来编排。我的选择是轻量级 Agent 框架,支持 DAG 编排、条件分支、失败重试。关键是要有可观测性:每个 Skill 的输入输出、耗时、成功率都要能追踪。
3.2 采集层 Skill 的配置与调试
以网页正文提取 Skill 为例,完整配置流程如下:
第一步:确定解析策略。先判断网页类型:新闻类、博客类、文档类、论坛类。不同类型用不同的解析规则。新闻类重点提取正文和发布时间,博客类重点提取正文和作者,文档类重点提取章节结构,论坛类重点提取主帖和回复。
第二步:配置提取规则。以博客类为例:
extract_rules = { "title": ["h1", "article h1", ".post-title"], "author": [".author", ".byline", "[rel='author']"], "date": ["time", ".post-date", "[datetime]"], "content": ["article", ".post-content", ".entry-content"], "exclude": [".ad", ".comment", ".related", "nav", "footer"] }第三步:调试与验证。拿 20 个不同类型的网页做测试,人工检查提取结果。重点看:正文是否完整、噪音是否清除、元数据是否准确。我实测下来,第一版规则通常只能覆盖 60% 的网页,需要迭代 3-5 轮才能到 90%。
第四步:异常处理。总有一些网页提取失败。我的做法是:失败时降级到通用提取,同时记录失败样本,定期分析补充规则。
3.3 拆解层 Skill 的参数调优
以语义分段 Skill 为例,核心参数有三个:
目标段长。这个参数决定知识单元的粒度。我的建议是:技术文档 500-800 字,学术论文 300-500 字,新闻 200-400 字,聊天记录 100-300 字。为什么不一样?因为不同材料的语义密度不同。技术文档一段话可能只讲一个点,学术论文一段话可能包含多个论点,新闻一段话通常是一个完整事件。
语义完整性阈值。这个参数决定切分点。计算相邻句子的语义相似度,低于阈值就切分。我的经验是:阈值设 0.6 比较通用,叙事文调到 0.5,说明文调到 0.7。
最小段长。防止切出太短的碎片。我的建议是:最小 150 字,低于这个长度的段落合并到相邻段。
调优流程:先拿 10 篇材料做人工分段,作为基准;然后用不同参数跑自动分段,对比基准计算准确率和召回率;最后选 F1 最高的参数组合。
3.4 关联层 Skill 的图谱构建实操
知识图谱构建是关联层最复杂的 Skill。完整流程:
第一步:实体抽取。从每个知识单元里抽取实体,标注类型和位置。输出格式:
{ "unit_id": "u001", "entities": [ {"text": "知识管理", "type": "concept", "start": 0, "end": 4}, {"text": "Skill", "type": "concept", "start": 5, "end": 10} ] }第二步:实体对齐。把不同表述的同一实体合并。比如“AI Agent”“智能体”“Agent”合并为一个节点。对齐策略:精确匹配优先,同义词表次之,语义相似度兜底。
第三步:关系抽取。识别实体之间的关系。关系类型包括:引用、相似、属于、导致、对比、时序。关系抽取靠的是模式匹配和模型预测结合。
第四步:图谱存储。节点和边写入图数据库。节点属性包括:名称、类型、描述、来源单元。边属性包括:关系类型、置信度、来源单元。
第五步:图谱查询。支持多种查询:按实体查关联、按关系查路径、按类型查子图。我实测下来,图谱查询对“找相关知识”场景效率提升最明显,比纯向量搜索准确率高 40%。
3.5 调用层 Skill 的检索与生成
以语义搜索 Skill 为例,完整检索流程:
第一步:查询理解。把用户自然语言查询转成结构化查询。识别查询意图(找定义、找方法、找案例、找对比)、识别关键实体、识别时间范围。
第二步:向量召回。用查询向量在向量数据库里召回 Top 50 知识单元。关键参数:召回数量 50,相似度阈值 0.5。
第三步:交叉重排。用交叉编码器对 50 个候选重新打分,取 Top 10。交叉编码器比向量相似度准确率高,但速度慢,所以只用于重排。
第四步:规则过滤。过滤掉低质量结果:来源不可靠的、时间过期的、内容重复的。
第五步:结果组装。把 Top 10 结果组装成用户可读的格式:每个结果附带来源、摘要、相关度分数。
4. 常见问题与排查技巧实录
4.1 采集层常见问题速查
| 问题现象 | 可能原因 | 排查方法 | 解决方案 |
|---|---|---|---|
| 正文提取不完整 | 解析规则不匹配 | 检查 DOM 结构 | 补充规则或降级到通用提取 |
| PDF 解析乱码 | 编码识别错误 | 检查 PDF 元数据 | 指定编码或走 OCR |
| 语音转写准确率低 | 音频质量差 | 检查采样率和信噪比 | 降噪预处理或换模型 |
| OCR 识别错误多 | 图片分辨率低 | 检查图片尺寸 | 放大图片或换 OCR 引擎 |
| 表格还原错乱 | 合并单元格处理不当 | 检查表格结构 | 保留原始表格图片作为附件 |
4.2 拆解层常见问题速查
| 问题现象 | 可能原因 | 排查方法 | 解决方案 |
|---|---|---|---|
| 分段太碎 | 语义阈值太高 | 检查分段结果 | 调低阈值或增大最小段长 |
| 分段太粗 | 语义阈值太低 | 检查分段结果 | 调高阈值或减小目标段长 |
| 论点提取遗漏 | 论证结构识别失败 | 检查论点标志词 | 补充标志词或换模型 |
| 数据点抽取错误 | 单位识别错误 | 检查数据上下文 | 保留原始上下文人工校验 |
| 引用识别失败 | 引用格式不常见 | 检查引用标记 | 补充格式规则 |
4.3 关联层常见问题速查
| 问题现象 | 可能原因 | 排查方法 | 解决方案 |
|---|---|---|---|
| 实体识别遗漏 | 垂直领域实体未覆盖 | 检查实体类型分布 | 微调模型或补充词典 |
| 概念对齐错误 | 同义词表不完整 | 检查对齐结果 | 补充同义词或调低相似度阈值 |
| 图谱查询慢 | 图谱太稠密 | 检查节点和边数量 | 分层建图或加索引 |
| 关联推荐不相关 | 相似度阈值太低 | 检查推荐结果 | 调高阈值或加规则过滤 |
4.4 调用层常见问题速查
| 问题现象 | 可能原因 | 排查方法 | 解决方案 |
|---|---|---|---|
| 搜索结果不相关 | 查询理解错误 | 检查查询解析结果 | 补充查询意图规则 |
| 摘要信息量低 | 摘要长度太短 | 检查摘要结果 | 增大摘要长度或提高信息密度 |
| 问答幻觉 | 知识库覆盖不足 | 检查引用来源 | 强制引用或设置置信度阈值 |
| 报告组装错位 | 模板匹配失败 | 检查模板和内容 | 调整模板或补充内容映射 |
4.5 独家避坑经验
坑一:不要追求一步到位。我一开始想一次性配齐 50 个 Skill,结果每个都半吊子。后来改成:先跑通采集-拆解-调用最小闭环,再逐步补充清洗和关联。这样每加一个 Skill 都能看到效果,迭代动力足。
坑二:不要忽视数据质量。采集层省的事,拆解层要加倍还回来。我试过用低质量采集数据跑拆解,结果分段乱七八糟,关联全是噪音。后来在采集层加了质量检查,不合格的直接打回重采。
坑三:不要迷信大模型。不是所有环节都需要大模型。采集层的解析、清洗层的过滤、拆解层的分段,这些用规则和小模型又快又稳。大模型用在真正需要语义理解的地方:实体识别、概念对齐、摘要生成。
坑四:不要忘记人工抽检。自动化再高,也要定期人工抽检。我的做法是:每周随机抽 20 个知识单元,人工检查采集质量、拆解质量、关联质量。发现问题就回溯到对应 Skill 调优。
坑五:不要忽视版本管理。50 个 Skill 的配置、参数、规则,这些都需要版本管理。我踩过的坑是:调好一个 Skill 的参数,过两周忘了为什么这么调,想改又不敢改。后来用 Git 管理所有配置,每次调优都写 commit message,问题迎刃而解。
4.6 性能优化技巧
批量处理。采集和拆解可以批量跑,不要一条一条处理。我的做法是:攒够 100 条材料,批量跑采集,再批量跑拆解。这样比单条处理快 5 倍以上。
缓存中间结果。采集结果、拆解结果、关联结果都缓存起来。重复材料直接读缓存,不重复计算。我实测下来,缓存命中率能到 30%,整体耗时降低 20%。
异步调度。50 个 Skill 不要串行跑,能并行的并行。采集层各 Skill 并行,拆解层各 Skill 并行,关联层各 Skill 并行。用异步调度框架,整体耗时降低 60%。
分级存储。热数据放内存,温数据放 SSD,冷数据放 HDD。我实测下来,分级存储让查询延迟降低 50%。
5. 知识管理 Skill 的扩展与演进
5.1 从 50 个到 100 个:Skill 的横向扩展
50 个 Skill 跑通之后,扩展方向很明确:按领域细分。通用采集 Skill 拆成专利采集、论文采集、新闻采集、社交采集;通用拆解 Skill 拆成技术拆解、学术拆解、商业拆解、法律拆解。
扩展的原则是:先跑通通用版,再按需细分。不要一上来就做垂直领域,那样容易过度设计。我自己的节奏是:通用版跑三个月,积累足够多的失败样本,再针对失败最多的场景做垂直 Skill。
5.2 从 Skill 到 Agent:编排层的演进
50 个 Skill 是能力单元,Agent 是调度器。初期可以用简单 DAG 编排,后期需要更智能的 Agent。Agent 的演进方向:
条件触发。根据材料类型自动选择 Skill 组合。检测到 PDF 走 PDF 解析,检测到音频走语音转写。
失败重试。某个 Skill 失败时,自动降级到备用 Skill。PDF 解析失败走 OCR,OCR 失败走人工队列。
动态编排。根据中间结果动态调整后续 Skill。拆解发现材料是学术论文,自动挂载引用识别 Skill。
反馈学习。根据人工抽检结果,自动调整 Skill 参数。分段太碎就调高阈值,实体遗漏就补充词典。
5.3 知识管理 Skill 的评估体系
没有评估就没有优化。我建议从四个维度评估:
采集质量。正文完整率、噪音清除率、元数据准确率。目标:正文完整率 95%,噪音清除率 90%,元数据准确率 90%。
拆解质量。分段准确率、论点召回率、数据点准确率。目标:分段准确率 85%,论点召回率 80%,数据点准确率 90%。
关联质量。实体识别 F1、概念对齐准确率、图谱查询准确率。目标:实体识别 F1 0.85,概念对齐准确率 0.9,图谱查询准确率 0.8。
调用质量。搜索准确率、摘要信息密度、问答准确率。目标:搜索准确率 0.8,摘要信息密度 0.7,问答准确率 0.85。
评估频率:每周小评,每月大评。小评抽 20 个样本,大评抽 100 个样本。评估结果直接反馈到 Skill 调优。
5.4 个人实操体会
这套系统我跑了半年多,最大的体会是:知识管理的瓶颈从来不是工具,而是人的判断力。Skill 能帮你把材料处理得干干净净、整整齐齐,但哪些知识值得留存、哪些关联值得建立、哪些结论值得信任,这些仍然需要你自己判断。
另一个体会是:不要追求完美。我一开始总想把每个 Skill 调到最优,结果陷入无限调优的循环。后来想通了:80 分的 Skill 组合起来,比 100 分的单个 Skill 有价值得多。系统整体跑通,比单个环节完美更重要。
最后一个体会:定期清理。知识库跟房间一样,不清理就会乱。我每个月做一次知识库清理:删掉过期的、合并重复的、归档低价值的。清理之后,检索准确率能提升 10% 以上。
提示:如果你刚开始搭建这套系统,建议从采集层和调用层入手。采集层决定输入质量,调用层决定输出价值。这两层跑通,中间层可以慢慢补。