研究问题:生物医学本体代码映射(如将ICD-9-CM代码映射到ICD-10-CM)是一项耗时费力的工作,现有流程依赖语言模型生成候选映射后由编码专家手动验证,且本体需定期更新,导致LM需频繁重训,成本高昂。
核心解决方案:提出OntologyRAG管道,将本体知识图谱与大型语言模型的检索增强生成(RAG)能力相结合,使编码专家能通过自然语言提问,获得带有映射邻近性评估和推理依据的可解释结果,从而更快、更准地完成代码映射。
一、研究背景与动机
生物医学代码映射的重要性:不同本体(如疾病本体、药物本体)对同一概念有不同的描述方式和层级结构,映射这些等价或相似概念是构建统一生物医学知识库的关键步骤。
现有流程的痛点:
自动生成候选映射后需编码专家手动验证,缺乏推理依据;
本体定期更新,LM需频繁重训,数据整理和计算成本高昂;
纯LLM直接映射准确率极低(实验中GPT-4仅8.38%)。
LLM与KG的互补性:LLM擅长自然语言理解与生成,但存在幻觉和知识陈旧问题;知识图谱能结构化存储最新本体信息,但查询需专业技能且结果难解释。两者结合(RAG)可优势互补。
二、OntologyRAG管道架构
管道包含三大模块:
1. 索引模块(Indexing)
功能:将本体源文件(如ICD-9-CM、ICD-10-CM的CMS/CDC官方文件)及未精炼映射(GEM文件)转换为标准RDF格式,存储为知识图谱(使用Oxigraph图数据库)。
关键技术:ETL流程(提取→转换→加载),支持多种源格式(表格、XML、纯文本等)。
2. 检索模块(Retrieval / NL2SPARQL)
功能:接收自然语言问题(NLQ),自动生成SPARQL查询并从知识图谱中检索相关子图。
实现方式:利用LLM进行NLQ到SPARQL的转换,包含提示工程(任务指令+图源列表+示例)和自验证检查点(确保查询语法正确且实体关系存在)。
实验结果:GPT-3.5-Turbo、GPT-4、Meta-Llama-3-8B均能在两次尝试内生成有效查询。
3. 推理与摘要模块(Reasoning & Summarization)
功能:对检索到的代码对进行映射邻近性评估,输出三个映射级别(A:完全一致;B:部分相关/不确定;C:部分冲突),并提供自然语言推理摘要。
实现方式:两步提示策略——先独立预测映射级别,再基于级别生成推理,最后汇总所有结果。
评估数据集:500对疾病描述及人工标注映射级别的金标准数据集。
三、实验与结果
实验1:纯LLM直接映射(消融研究)
任务:零样本提示LLM将ICD-9-CM代码直接映射到ICD-10-CM。
结果:最佳模型GPT-4仅达8.38%准确率,说明纯LLM无法胜任此任务。
实验2:NL2SPARQL检索能力
模型:GPT-3.5-Turbo、GPT-4、Meta-Llama-3-8B。
结果:所有模型均能在两次尝试内生成有效SPARQL查询;GPT系列输出格式更规范,Llama-3需轻量后处理。
实验3:映射级别预测(核心评估)
模型:四种LLM(GPT-3.5-Turbo、GPT-4、Meta-Llama-3-8B、Google-Flan-T5-XXL)。
提示策略:零样本、少样本(16例)、增强少样本(21例,B类更多)、思维链(CoT)。
主要发现:
少样本学习显著提升所有模型性能;
CoT对GPT和Llama-3有效,但对Flan-T5(编码器-解码器结构)效果不佳;
Meta-Llama-3-8B表现接近GPT-4,是优秀的开源替代方案;
在C级别(明确冲突)预测上,GPT-4和Llama-3均达>95%精确率;
CoT策略下,Llama-3在A级别精确率甚至超过GPT-4(近83%);
A与B的区分是最大难点,但少样本和CoT策略能显著改善。
实验4:推理质量
因推理输出的生成性质,未采用自动评估(如ROUGE-L),而是人工检查。
发现推理质量与映射级别预测准确率高度相关,级别预测结果足以反映模块有效性。
四、主要贡献
提出OntologyRAG管道:首个将本体知识图谱与LLM-RAG结合用于生物医学代码映射的完整解决方案。
降低技术门槛:通过NL2SPARQL模块,允许用户用自然语言查询复杂本体图谱。
提供可解释性:输出包含映射级别和自然语言推理,帮助编码专家聚焦于模糊/复杂案例(B级别),加速验证流程。
无需重训LLM:本体更新只需更新知识图谱,避免频繁模型重训的成本。
开源与可复现:提供两个金标准数据集、代码、提示模板及演示视频。
模块化与灵活:索引、检索、推理模块松耦合,可灵活替换不同LLM或本体来源。
五、局限性及未来工作
局限性:
推理输出的自动评估尚未建立金标准;
目前为研究原型,尚未达到生产级应用。
未来方向:
将原型扩展为生产级系统,支持快速、鲁棒的大规模本体映射;
探索更完善的推理质量自动评估方法;
进一步优化A/B级别区分能力。
OntologyRAG通过知识图谱提供最新、结构化的本体知识,通过LLM提供自然语言理解、查询生成和推理能力,有效解决了传统代码映射中重训成本高、结果不可解释、专家负担重三大痛点。实验证明,该管道在映射邻近性评估上表现优异,尤其Meta-Llama-3-8B等开源模型在特定策略下可达接近GPT-4的水平,具备实际应用潜力。该工作为生物医学本体管理与代码映射提供了一种高效、可扩展、可解释的新范式。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
项目地址在这里,如下所示:
摘要。生物医学本体论全面定义了生物医学实体的概念和关系,对于构建和形式化特定领域的信息表示至关重要。生物医学代码映射旨在识别不同本体论中概念之间的相似性或等价性。获得高质量的映射通常依赖于使用经过本体领域微调的语言模型(LM)自动生成未精炼的映射,然后由编码专家进行手动选择或修正,这些专家拥有广泛的领域专业知识和对本体系模式的熟悉度。语言模型通常以候选列表的形式提供未精炼的代码映射建议,而不附带推理或支持证据,因此编码专家仍然需要对照本体来源验证每个建议的候选者,以挑选出最佳匹配。由于本体来源会定期更新以纳入新的研究发现,这也是一项重复性任务。因此,语言模型的定期再训练和手动精炼的需求使得代码映射既耗时又耗费人力。
在这项工作中,我们创建了 OntologyRAG,一种本体增强的检索增强生成(RAG)方法,该方法利用本体知识图谱中的归纳偏差,用于大型语言模型(LLM)的上下文学习(ICL)。我们的解决方案将LLM与包含本体间未精炼映射的知识图谱相结合,并通过生成一组可解释的结果来处理问题,这些结果包括带有映射邻近性评估的预测依据。我们的解决方案不需要重新训练LM,因为所有本体更新都可以通过标准流程更新知识图谱来反映。在我们自策金标准数据集上的评估结果显示,使用我们的方法有望使编码专家能够更好、更快地进行代码映射。
关键词:生物医学代码映射, 检索增强生成, 大型语言模型, 本体知识图谱。
1 引言
生物医学本体论以结构化和层次化的形式表示领域特定概念的语义定义和关系[1]。在不同的本体论中,等价概念通常被描述为具有不同的关联关系或层次结构,以捕捉不同概念背后的临床细微差别——例如,对于1型糖尿病,疾病本体论会包括其父类别如自身免疫性疾病和/或糖尿病的关系,而药物本体论则会将其与胰岛素关联[2][3]。跨本体论映射这些语义上相似或等价的概念——通常被称为代码映射——是构建生物医学知识库整体形式化表示的重要一步。[4][5][6]。
值得注意的是,生成、存储和更新代码映射极具挑战性——原因在于本体论模式和源格式的多样性、理解生物医学细微差别所需的领域专业知识,以及需要跟上定期本体更新的需求,这些更新通常包含同义词和层次结构的变化[3][7]。为了实现高质量的代码映射,现有流程通常涉及两个主要步骤:使用诸如专门针对本体感知进行微调的语言模型(LM)等方法生成未精炼的映射作为建议候选列表,然后依靠编码专家进行验证和手动精炼以选择最佳匹配项[8][9][10]。手动精炼步骤非常必要,因为大多数语言模型难以正确映射语义相似但生物医学上不同的概念——例如,急性肾脏疾病可以映射到肾脏疾病,但反之则不然。但手动精炼通常耗时且费力。这是因为通常没有关于映射邻近性的指示或推理,因此即使提供了顶级匹配候选列表,编码专家仍然需要对照本体来源和相关材料验证每个案例[11][12]。此外,本体提供者为将最新研究成果纳入本体而进行的定期本体更新,使得在维护存储映射代码的数据库期间,重新训练LM和重新验证选定候选者成为一项高要求且重复性的任务。
近来,大型语言模型(LLM)在各种与文本相关的生成式任务中显示出巨大潜力,这些模型最突出的特点是其通用的自然语言理解能力和模型泛化性。然而,与所有模型一样,LLM在处理外部或未见知识以及过时的内部知识方面存在困难。此外,定期重新训练或微调LLM以适应本体来源的变化将成本高昂且耗费人力——因为这需要频繁的培训数据整理、昂贵的计算设置以及模型处理专家。[13] 另一方面,知识图谱(KG)在存储本体中丰富的语义和层次信息方面已显示出有效性,并且更新存储在KG中的信息也 straightforward [14][15]。然而,访问存储的信息需要了解查询语言和特定的图元数据,同时检索到的图通常难以解释。研究表明,当LLM和KG结合使用时,例如在检索增强生成(RAG)系统中,它们可以互补各自的局限性,其中LLM可用于检索、推理和词汇化知识图谱中编码的信息,以增强图谱的可访问性和可解释性[16][17][18],提供可靠且最新的外部知识,从而在众多应用中提供卓越的便利性。[19][20]
在这项工作中,我们提出了一个定制的本体增强检索增强生成管道(OntologyRAG),它通过注入本体知识图谱,利用现成LLM的上下文推理能力,使编码专家能够更好、更快地执行代码映射。该管道包含三个部分:索引(将本体源文件转换为标准格式,生成未精炼的映射,并将信息作为知识图谱存储在数据库中)、检索(生成SPARQL查询以从数据库中检索子图)以及对检索结果进行推理(提供映射邻近性和摘要)。通过对专家策展的金标准数据集进行评估,我们展示了OntologyRAG通过联合利用本体知识图谱中编码的结构化信息和LLM的语言生成能力,有潜力显著提高代码映射的质量和效率。
图1. 我们提出的用于代码映射的本体增强检索增强生成(OntologyRAG)工作流程示意图。
2 方法
我们提出的方法以LLM为核心。在我们的工作中,我们首先进行了一项消融研究,评估LLM直接进行代码映射预测的能力,然后转向RAG管道的构建和评估。最终的OntologyRAG原型在索引过程中将本体信息(如代码描述、关系和本体间的未精炼映射)存储到RDF知识图谱中,并通过一种LLM支持的方法检索这些信息,该方法允许用户使用自然语言问题(NLQ)查询数据库。原型的响应是一个包含检索结果、代码映射级别和相关推理的文本摘要(图1)。
2.1 无知识图谱的LLM代码映射消融研究
为了了解LLM在执行代码映射任务时的开箱即用能力,我们策展了一个包含从ICD-9-CM到2018年4 H. Feng, Y. Yin, E. Reynares and J. Nanavati
版ICD-10-CM的500个映射的金标准数据集。通过使用选定的LLM在默认温度下进行零样本实验来进行消融研究,提示中的任务指令为“任务摘要:您是一名临床编码员,正在为现有的ICD9CM代码分配ICD10CM代码。指令:请根据2018年版本,为提供的ICD9CM代码分配相应的ICD10CM代码。如果可以映射多个ICD10CM代码,请全部列出。”
如果LLM的响应包含正确的映射代码,我们认为预测正确。如果金标准数据集中列出了多个ICD-10-CM代码,我们对模型的每个正确预测给予积分,并且不因返回额外代码而惩罚。例如,如果金标准数据集标注的代码是[代码A, 代码B],而LLM预测的代码是[代码A, 代码C, 代码D],我们认为代码A的预测正确,代码B的预测不正确,因此该预测的准确率为50%。
评估了两个OpenAI模型(GPT-3.5-Turbo 和 GPT-4)[21] 和两个开源模型(Meta-Llama-3-8B [22] 和 Google-Flan-T5-XXL [23]),这些模型已被证明在生物医学语言理解与推理基准(BLURB)任务上表现良好[24]。每个实验重复三次,使用所有数据点的平均准确率作为评估指标。
2.2 本体知识图谱生成与索引
对于每个感兴趣的本体,使用该管道的先决条件是构建一个知识图谱,该图谱捕获新本体和现有本体的层次结构化信息(特征、关系和未精炼映射)。我们通过应用ETL(提取、转换、加载)处理模式来构建这样的知识图谱。
在提取阶段,我们根据源文件执行各种任务(从解压文件到执行专用SQL脚本)来获取原始格式的数据。例如,我们检索了国际疾病分类,临床修订版,第九次和第十次修订(ICD-9-CM和ICD-10-CM)。ICD-9-CM诊断和程序代码及标签从美国医疗保险和医疗补助服务中心(CMS)官方网站[25]检索。ICD-9-CM文件以两列表格形式提供诊断和程序的代码及标签。ICD-10-CM诊断和程序代码及标签从美国疾病控制与预防中心(CDC)官方网站[26]检索。ICD-10-CM文件以专有模式下的XML文件形式提供诊断和程序的代码及标签。ICD-9-CM到ICD-10-CM的映射——称为通用等价映射(GEM)文件——从CMS官方网站[27]检索。GEM文件通常以纯文本格式提供,每行代表一个映射条目。每个条目包括源代码、目标代码以及任何相关的标志或属性,例如,一对一、一对多或多对一关系,以及指示映射是近似还是精确的标志。
然后,执行每个源特定的定制转换器,从提取的数据生成基于RDF的表示。RDF是由万维网联盟(W3C)开发的一种标准模型,提供了一种结构化的方式来描述和链接数据[28]。RDF数据组织为三元组,每个三元组包含主体、谓词和客体,形成一个有向图,其中节点表示资源,边表示它们之间的关系。三元组结构允许以一种灵活且可扩展的方式表示信息,这使得RDF在我们这样需要集成和共同使用来自不同来源的数据的用例中特别有用。在撰写本工作时,我们尚未完成开放源代码转换器阶段代码库的内部流程,尽管此类过程的输出可以在提到的GitHub存储库中找到。
最后,我们将RDF数据加载到Oxigraph [29]中。Oxigraph是一个用Rust编写的开源图数据库,基于RocksDB键值存储[30]。它提供了一组用于读取、写入和处理RDF文件的实用函数。可以通过使用SPARQL协议和RDF查询语言(SPARQL)[31]编写的查询来操作和检索此RDF数据。SPARQL是W3C开发的一项标准,其查询语法类似于SQL,并基于对RDF数据的三元组模式匹配。SPARQL支持四种主要类型的查询:SELECT, CONSTRUCT, ASK和DESCRIBE。SELECT查询检索特定数据元素并返回一个结果表,类似于SQL。CONSTRUCT查询检索数据元素并从这些元素生成一个新的RDF图。ASK查询检查数据中是否存在特定模式,并返回一个布尔值,指示是否找到了该模式。最后,DESCRIBE查询检索一个RDF图,该图描述特定资源或一组资源,提供关于它们的详细信息。
图2. 在NLP2SPARQL模块中生成SPARQL查询的提示,包括输入NLQ、图源和NLQ到SPARQL的示例。
2.3 子图检索
一旦本体图准备就绪,如2.2节所述,就需要SPARQL查询从数据库中检索与本体相关问题相关的子图。
然而,构建有效且正确的SPARQL查询以检索结果,既需要专业的SPARQL查询构建技能,也需要对知识图谱的熟悉程度。为了消除这一技术障碍,我们在OntologyRAG管道中创建了NL2SPARQL模块,该模块接收自然语言问题(NLQ)并返回一个SPARQL查询,从而可以直接使用NLQ从本体图数据库中检索信息。
NL2SPARQL模块接收一个NLQ作为输入,然后将其作为输入参数添加到一个提示模板中,该模板详细说明了任务指令、图源列表以及一些NLQ到SPARQL的示例,以为LLM创建一个实时提示来生成SPARQL查询(图2)。SPARQL生成过程还包括一个自我验证检查点,以检查生成的SPARQL的有效性。除了验证输出是否具有正确的SPARQL语法外,它还验证查询描述的图源、实体和关系是否存在于本体图数据库中。如果生成的SPARQL查询无效,它将自动重复SPARQL生成过程,直到查询有效并可用于从图数据库中检索信息。
2.4 映射邻近性评估与摘要生成
如2.2节所述,KG数据库中本体间的索引映射是未精炼的映射,这意味着代码之间可能存在不正确的映射,并且需要编码专家验证和更新这些映射,以获得可用于其他生物医学或临床任务的高质量精炼映射。
为辅助验证过程,我们创建了推理与摘要模块,该模块接收NLQ和代码对(NLQ中查询的代码和NL2SPARQL检索到的代码)作为输入,根据语义相似性和逻辑推理分配表1中三个映射级别之一,然后返回自然语言摘要作为输出(图3)。
表1. 代码对映射级别的定义。
在推理步骤中,我们使映射级别预测任务独立于推理,以提高LLM对本体的预测性能。提示LLM两次以:1)预测检索到的代码对的两个疾病描述之间的映射级别;2)基于上述预测的映射级别给出推理(图3)。最后,将输入NLQ、检索到的代码对、预测的映射级别以及推理再次输入LLM,总结所有代码映射结果。
为了比较推理与摘要模块中不同模型的映射级别预测能力,创建了一个包含500对疾病描述及其对应映射级别的金标准数据集。在创建金标准数据集时,我们首先使用GPT-3.5-Turbo根据常见的疾病分类系统生成了500对疾病描述,并根据表1所述基于语义相似性预测了这些疾病描述对的映射级别,然后由领域专家进行手动修订。金标准数据集中的每条记录包含两个疾病描述和一个描述语义邻近性的映射级别。
图3. 推理与摘要模块推理步骤中用于1)映射级别预测和2)推理的提示。
针对2.1节中提到的所有模型,比较了四种不同的提示策略:1)零样本:无示例;2)少样本:16个示例;3)示例增强少样本:21个示例,其中为映射级别B增加了5个示例,因为B代表部分语义相似或不确定的情况,其覆盖的组合比A或C更多样;4)带有示例增强少样本的思维链:基于示例增强少样本(21个示例)。每个实验重复三次,并使用不同LLM和提示策略的平均准确率和每个映射级别的精确率作为评估指标。
3 结果与讨论
3.1 无知识图谱的LLM代码映射消融研究
如表2所示,对于使用我们金标准数据集的消融研究,当使用零样本提示直接要求LLM返回映射代码时,所选模型均未达到超过10%的整体准确率,表现最佳的模型(GPT-4)仅达到8.38%。
除了LLM固有的幻觉局限性外,这种糟糕的表现可能还与大多数本体源文件是专有数据——意味着大多数LLM可能未接受过此类数据的训练——以及每个本体代码背后编码的领域特定语义复杂性有关。
我们的消融研究不仅显示了本体代码映射任务的复杂性,也揭示了仅使用LLM执行此类任务的巨大差距。
表2. 使用不同LLM直接进行代码映射的准确率(%)
3.2 SPARQL查询生成与子图检索
对于NL2SPARQL模块,我们实验了三种SOTA指令微调LLM:GPT-3.5-Turbo, GPT-4, Meta-Llama-3-8B。这些LLM未经过进一步微调,结果显示所有三个模型都能够在两次尝试内生成准确的SPARQL查询,以从正确的知识图谱中检索信息。
然而,LLM返回的响应格式略有不同。虽然提示指示模型仅输出生成的SPARQL查询而不附带任何无关文本,但只有GPT-3.5-Turbo和GPT-4能够按请求提供指定响应,输出开箱即用、无需进一步后处理的SPARQL查询。相比之下,Meta-Llama-3-8B倾向于在其输出中包含额外的对话或对提示的回复,这需要一些轻量级的后处理工作来提取嵌入在响应中的SPARQL查询。
3.3 映射邻近性评估与推理评估
对于推理与摘要模块,我们收集并策展了一个包含500条记录的金标准数据集用于性能评估,每条数据点包含两个疾病描述和一个手动分配的映射级别。评估了模型选择、提示策略和温度对映射级别预测整体准确率(相对于金标准数据集)的影响。我们发现,与零样本学习相比,少样本学习有助于提高所有测试模型的性能。尽管CoT提示对GPT模型和Meta-Llama-3-8B-Instruct都产生了更好的性能,但对Google-Flan-T5-XXL却产生了较差的性能。这可能是因为Google-Flan-T5-XXL是唯一一个编码器-解码器模型,而其他三个是仅解码器模型。我们还注意到,Meta-Llama-3-8B-Instruct在两种少样本提示策略下的性能都超过了GPT-3.5-Turbo和Google-Flan-T5-XXL,并接近GPT-4(表3),考虑到模型的参数量,这令人印象深刻,使其成为执行此任务的有前途的开源候选模型。
表3. 使用不同提示策略进行代码映射级别预测的准确率(%)
由于这些映射级别旨在帮助编码专家关注模糊或复杂的案例,我们需要考虑每个映射级别对人类审查员的影响。例如,在A和C级别上的高精度预测表明有可能引入自动生成的分组过滤器,允许审查员直接接受或拒绝这些语义上更明显的映射结果。这可能使这些编码专家能够只关注那些被归类为B级别的映射结果,即困难和模糊的案例,从而加速代码映射过程。
图4. 使用不同提示方法在每个级别上的生物医学代码映射精确率
鉴于需要对三个映射级别进行不同权衡,LLM的整体准确率不应是评估其映射级别分配性能的唯一指标。为了帮助衡量更适合此模块的模型,我们将每个映射级别预测的精确率作为另一个评估指标,并优先考虑能够为A和C级别提供更高精确率的模型。
所有测试的LLM和提示方法的组合在C级别预测上都达到了相对较高的精确率(>80%)。值得注意的是,GPT-4和Meta-Llama-3-8B的所有组合都达到了>95%的精确率。思维链(CoT)提示策略——要求LLM在进行级别预测之前进行推理——在映射级别A上为两个开源LLM都产生了最高的预测精确率,Meta-Llama-3-8B甚至以近83%的得分超过了GPT-4(图4)。
区分A和B级别对LLM来说似乎更具挑战性。这可以看作模型认为两个代码密切相关且一致,但仍难以确定它们是否完全匹配。我们深入研究了这些模型的结果,并使用混淆矩阵来帮助更好地理解错误分类的细节(图5)。从矩阵中,我们可以看到提示工程对预测映射级别C的影响远小于对其他两个级别的影响。我们还可以看到,在零样本方法下,Meta-Llama-3-8B和Google-Flan-T5-XXL倾向于预测映射级别A和C多于映射级别B,同时将许多B级别案例错误分类为A级别,而GPT-3.5-Turbo和GPT-4在所有三个映射级别上具有更好的预测平衡。然而,令人鼓舞的是,少样本、增强少样本和CoT方法都有效地帮助Meta-Llama-3-8B“理解”区分映射级别A和B的细微差别,从而显著提高了其在这两个级别上的预测精确率。这些提示工程策略也进一步增强
如2.4节所述,为了帮助编码专家理解决预测映射级别背后的原理,所有LLM还被要求提供自然语言推理来支持预测。为了评估生成的推理输出,我们考虑了使用诸如rouge-L等指标进行自动评估。然而,由于LLM的生成性质,极难预测自然语言响应的构建方式。因此,很难生成一个公平的金标准,包含预期的推理答案,以自动评估自然语言推理输出的质量。尽管我们认为拥有一个稳健的方法来构建用于自动评估推理输出的金标准数据集可能是一项有趣的工作,但它超出了本研究的范围,但可能是我们未来感兴趣的方向。在本研究中,我们手动检查了推理响应,发现推理的总体质量与映射级别预测密切相关。
因此,我们认为呈现映射级别预测的结果足以展示不同LLM在执行与推理与摘要模块相关任务中的有效性。
4 结论
在这项工作中,我们创建了OntologyRAG,一个利用本体知识图谱和LLM的上下文学习能力,使编码专家能够更好、更快地进行生物医学代码映射的管道。我们工作的主要贡献是:
创建了OntologyRAG,一个基于LLM的RAG管道,用于本体代码映射。展示了其在索引和检索复杂本体相关信息方面的有效性,并展示了其辅助代码映射精炼的前景。提供了两个金标准数据集,一个用于评估模型直接进行代码映射能力的准确率,另一个用于评估模型进行代码映射邻近性预测能力的有效性。评估了几种最先进的LLM相对于我们金标准数据集的有效性,并提供了研究结果。
OntologyRAG管道具有可扩展性和通用性。它包含一个即用型索引模块,可以将大多数本体源文件和映射文件转换并存储到知识图谱数据库中;一个检索模块,以自然语言问题作为输入,自动生成有效的SPARQL查询,从图数据库中检索与问题相关的信息;以及一个推理与摘要模块,评估检索信息与输入问题的相关性,然后输出带有自然语言推理的相关性邻近性。我们管道中LLM的选择是灵活的。我们提供的金标准数据集和评估方法可以帮助决定在管道维护期间是否需要升级LLM。
我们的结果显示,将诸如Meta-Llama-3-8B和GPT-4等现成LLM纳入其中,以增强本体知识图谱中编码的复杂信息的可访问性和可解释性,具有巨大潜力。通过接受自然语言问题并提供包含检索结果和预先分析的映射级别及推理的输出,该管道允许编码专家将精力集中在最模糊和复杂的映射案例上,而不是所有案例,从而提高映射效率和质量。
该研究原型展示了将LLM与KG集成以辅助代码映射精炼的良好前景。该管道便于未来性能增强的LLM的快速灵活适应,并确保在更新知识图谱以反映本体变化时具有快速响应能力。未来的研究将侧重于探索如何将此原型扩展和增强为生产级应用,以促进快速且稳健的本体映射。