1. 引言
大语言模型(LLM)驱动的 Agent 在复杂任务中展现出卓越能力,但受限于上下文窗口与单轮推理范式,难以在长周期、多轮次的交互中维持稳定一致的记忆。Memory(记忆)机制由此成为 Agent 领域的前沿研究方向。本文以中医诊断这一典型的长周期、强领域依赖场景为切入点,系统梳理 Memory 科研的问题定义、数据构建、对比实验设计与参考文献,旨在为研究者提供一套可复现、可扩展的实验框架。
2. Memory 科研要解决的核心问题
2.1 记忆的存储与组织
Agent 需要将对话历史、用户画像、领域知识等多源信息进行结构化存储。其核心问题可归纳为以下三个层面:
记忆的表示形式:自然语言摘要、向量嵌入、知识图谱三元组,还是结构化槽位?不同表示在可解释性、可扩展性与检索效率上各有取舍。
记忆的分层:短期记忆(当前会话)与长期记忆(跨会话)如何划分与协同?
记忆的索引与检索:如何在海量记忆中快速、精准地定位与当前问题相关的片段?### 2.2 记忆的写入与更新
写入时机:每轮对话后、任务完成后,还是达到特定阈值后触发写入?
冗余与冲突消解:同一事实多次出现时如何合并去重,矛盾信息如何取舍?
遗忘机制:过时或错误信息如何被淘汰或修正,以保持记忆的时效性?### 2.3 记忆的检索与利用
检索策略:基于向量相似度、基于规则、基于 LLM 自主判断,还是混合策略?
检索粒度:返回整段记忆、关键句子,还是结构化事实?
注入方式:检索结果如何注入 Prompt——直接拼接、重排后拼接,还是作为工具调用结果?### 2.4 记忆的评估
记忆本身的质量:准确性、完整性、时效性如何度量?
记忆对下游任务的影响:加入记忆后,诊断准确率、用户满意度是否提升?
记忆评估指标速查表如下:
| 指标类别 | 具体指标 | 计算公式 | 数据来源 | 建议评估方式 |
|---|---|---|---|---|
| 准确性 | 记忆准确率 | 准确率 = 正确记忆数 / 总记忆数 | 人工标注(专家核对记忆与事实的一致性) | 离线评测 |
| 准确性 | 事实一致性 | 一致性 = 与金标准一致的事实数 / 总事实数 | 自动比对(与病历金标准字段对齐) | 离线评测 |
| 完整性 | 记忆覆盖率 | 覆盖率 = 已捕获关键信息数 / 应捕获关键信息总数 | 人工标注(对照预设关键信息清单) | 离线评测 |
| 完整性 | 信息召回率 | 召回率 = 检索到的相关记忆数 / 全部相关记忆数 | 自动比对(与标注的相关记忆集合比对) | 离线评测 |
| 时效性 | 记忆新鲜度 | 新鲜度 = 1 - 过时记忆数 / 总记忆数 | 人工标注(专家判断记忆是否过时) | 离线评测 |
| 时效性 | 更新及时率 | 及时率 = 按时更新的记忆数 / 应更新记忆总数 | 自动比对(对比复诊记录与记忆更新时间戳) | 离线评测 |
| 对下游任务影响 | 诊断准确率增益 | 增益 = 带记忆诊断准确率 - 无记忆诊断准确率 | 自动计算(对比实验输出与金标准) | 在线 A/B 测试 |
| 对下游任务影响 | 用户满意度 | 满意度 = 满意评价数 / 总评价数 | 用户反馈(患者/医师问卷评分) | 在线 A/B 测试 |
针对上述核心问题,可采用的算法与方案如下:
| 核心问题 | 可选算法/方案 | 说明 |
|---|---|---|
| 记忆的表示形式 | 向量嵌入(Sentence-BERT、OpenAI Embedding)、知识图谱三元组(TransE、RotatE)、结构化槽位(JSON Schema) | 文本语义用向量,领域关系用图谱,结构化事实用槽位 |
| 记忆的分层 | 分层记忆网络(Hierarchical Memory Network)、短期/长期双缓冲池 | 短期存会话上下文,长期存跨会话事实,按重要性迁移 |
| 记忆的索引与检索 | 稠密向量检索(DPR、Contriever)、BM25 稀疏检索、混合检索(RRF 融合)、图检索(GraphRAG) | 向量召回语义相似片段,图谱检索结构化关系 |
| 记忆的写入与更新 | 增量式写入(append-only + 去重)、LLM 摘要压缩(MapReduce)、冲突消解(置信度投票、时间戳优先) | 新事实追加,重复合并,矛盾按时间与置信度取舍 |
| 遗忘机制 | 时效衰减(指数衰减权重)、基于访问频率的 LRU 淘汰、LLM 定期重写压缩 | 过时记忆降权或删除,保持记忆新鲜度 |
| 记忆的检索与利用 | RAG(检索-增强生成)、ReAct(推理-行动循环)、Reflexion(反思-重试) | 检索结果注入 Prompt,Agent 依据记忆推理与行动 |
3. 中医诊断场景下的 Memory 科研设计
3.1 场景特点与科研切入点
中医诊断强调「望闻问切」四诊合参,且诊疗过程往往跨越多次复诊。这为 Memory 科研提供了独特场景:
- 长期性:患者多次就诊,需要跨会话记忆既往症状、方剂与疗效。
- 多模态:舌象、脉象、面色等非文本信息需要与文本记忆关联。
- 领域知识:中医辨证论治体系(八纲辨证、脏腑辨证等)可作为结构化记忆骨架。
- 个性化:不同体质、不同证型的患者需要差异化记忆策略。
3.2 可研究的 Memory 子问题
| 子问题 | 具体研究点 | 对应 Memory 环节 |
|---|---|---|
| 患者画像构建 | 从首诊对话中抽取体质、既往史、过敏史 | 写入与组织 |
| 复诊记忆召回 | 跨会话检索既往症状与方剂,避免重复问诊 | 检索与利用 |
| 证型演化追踪 | 记录证型随治疗的变化,支持动态辨证 | 更新与遗忘 |
| 四诊信息融合 | 将舌象/脉象描述与文本主诉关联存储 | 多模态记忆 |
| 记忆冲突消解 | 患者自述与客观检查不一致时如何取舍 | 更新与修正 |
下面以「风寒束肺证」为例,展示如何将中医辨证论治体系构建为知识图谱,作为 Graph-Memory 的结构化骨架:
该图谱以「风寒束肺证」为中心节点,通过「表现为」「舌象」「脉象」「治则」「主方」「加减」等关系边,将症状、舌象、脉象、方剂等实体组织为三元组结构。作为 Graph-Memory 的结构化骨架,它带来三点收益:
- 可推理:图谱支持沿关系边进行多跳推理,例如从「脉浮紧 + 舌淡红苔薄白」反推「风寒束肺证」,再沿「治则」边定位到「麻黄汤」,实现辨证到方剂的自动推导。
- 可更新:患者复诊时新增的症状或方剂调整,只需在对应节点上增删关系边,即可完成记忆更新,避免整段重写。
- 可检索:图谱天然支持按实体或关系检索,比纯向量检索更精准,能直接回答「该患者既往用过哪些方剂」「证型如何演化」等结构化问题。
4. 需要的数据
4.1 数据来源
- 公开中医病历数据集:如 TCM 电子病历、中医临床科研数据平台。
- 自建模拟数据:基于中医教材(如《中医诊断学》)构造标准化病人对话。
- 真实脱敏数据:与医院合作获取脱敏后的门诊记录(需伦理审批)。
4.2 数据字段设计
| 字段 | 说明 | 示例 |
|---|---|---|
| patient_id | 患者唯一标识 | P001 |
| visit_id | 就诊序号 | V1, V2, V3 |
| timestamp | 就诊时间 | 2026-03-01 |
| symptoms | 主诉与症状描述 | 咳嗽、痰白、畏寒 |
| tongue | 舌象描述 | 舌淡红、苔薄白 |
| pulse | 脉象描述 | 脉浮紧 |
| diagnosis | 辨证结果 | 风寒束肺证 |
| prescription | 方剂与用药 | 麻黄汤加减 |
| follow_up | 复诊反馈 | 服药后咳嗽减轻 |
4.3 数据规模建议
- 冷启动阶段:500–1000 条模拟对话用于机制验证。
- 完整实验:5000 条以上多轮对话,覆盖至少 10 种常见证型。
- 每例患者至少 3 次就诊记录,以支撑跨会话记忆实验。
5. 对比实验设计
5.1 基线方法
| 方法 | 说明 |
|---|---|
| No-Memory | 每次诊断仅基于当前对话,无历史记忆 |
| Full-Context | 将所有历史对话全部拼入上下文(受窗口限制) |
| Vector-Retrieval | 用向量检索召回 Top-K 历史片段 |
| Summary-Memory | 用 LLM 生成历史摘要后注入 |
| Graph-Memory | 用知识图谱存储患者事实与证型关系 |
5.2 实验维度
- 诊断准确率:辨证结果与金标准的一致性(精确率、召回率、F1)。
- 信息利用率:诊断过程中是否有效利用了既往史(可设计「必须依赖既往史才能正确辨证」的测试样本)。
- 效率指标:Token 消耗、推理延迟、检索耗时。
- 鲁棒性:记忆噪声(错误历史)对诊断的影响。
- 消融实验:分别去掉记忆写入、检索、更新模块,观察性能变化。
消融实验设计如下:
| 消融设置 | 去除模块 | 预期影响的指标 | 实验目的 |
|---|---|---|---|
| 去掉记忆写入 | 记忆写入模块 | 诊断准确率下降 5%–10%;Token 消耗略降(无需写入开销) | 验证记忆写入对跨会话信息积累的必要性 |
| 去掉记忆检索 | 记忆检索模块 | 诊断准确率下降 10%–15%;信息利用率显著降低;Token 消耗上升(需拼接全部历史) | 验证检索机制对精准召回既往史的关键作用 |
| 去掉记忆更新 | 记忆更新/遗忘模块 | 诊断准确率下降 3%–8%;记忆冗余与冲突增多;鲁棒性下降 | 验证更新与遗忘机制对保持记忆时效性和一致性的贡献 |
| 完整系统 | 无(保留全部模块) | 作为基准,诊断准确率最高;Token 消耗与延迟处于合理区间 | 作为对照,衡量各模块的边际收益 |
5.3 实验流程
- 构造测试集:每例患者含首诊与多次复诊,标注金标准辨证。
- 对每种方法运行完整诊断流程,记录输出。
- 计算指标并做显著性检验(如配对 t 检验或 Wilcoxon 检验)。
- 人工评估:由中医专家对诊断理由的合理性打分。
下面是完整的实验流程图:
各步骤的输入输出说明如下:
- 构造测试集:输入为原始病历数据(含首诊与多次复诊记录),输出为带金标准辨证标注的测试集,每例患者至少包含 3 次就诊记录。
- 基线方法运行:输入为测试集与各基线方法(No-Memory、Full-Context、Vector-Retrieval、Summary-Memory、Graph-Memory),输出为每种方法在每例患者上的诊断结果。
- 指标计算:输入为各方法的诊断输出与金标准,输出为诊断准确率、信息利用率、Token 消耗等指标。
- 显著性检验:输入为各方法的指标结果,通过配对 t 检验或 Wilcoxon 检验判断差异是否显著;若不显著则回到基线方法运行环节排查问题。
- 专家评估:输入为通过显著性检验的诊断结果,由中医专家对诊断理由的合理性打分,最终输出实验结果。
6. 参考文献与链接
以下文献覆盖 Memory 机制、RAG、Agent 记忆与医疗 AI 方向,可作为实验设计与论文写作的支撑:
Park et al., “Generative Agents: Interactive Simulacra of Human Behavior”(生成式 Agent 的记忆流与反思机制)
- 链接:https://arxiv.org/abs/2304.03442
Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”(RAG 基础框架)
- 链接:https://arxiv.org/abs/2005.11401
Zhong et al., “MemoryBank: Enhancing Large Language Models with Long-Term Memory”(长期记忆银行与遗忘机制)
- 链接:https://arxiv.org/abs/2305.10250
Modarressi et al., “RET-LLM: Towards a General Read-Write Memory for LLMs”(通用读写记忆)
- 链接:https://arxiv.org/abs/2305.14322
Wang et al., “Unleashing the Power of LLMs in Medical Diagnosis”(LLM 在医疗诊断中的应用)
- 链接:https://arxiv.org/abs/2405.16469
Zhang et al., “HuatuoGPT: Towards Medical Dialogue Generation”(中医/医疗对话生成)
- 链接:https://arxiv.org/abs/2305.15075
Yao et al., “ReAct: Synergizing Reasoning and Acting in Language Models”(Agent 推理与行动结合)
- 链接:https://arxiv.org/abs/2210.03629
Shinn et al., “Reflexion: Language Agents with Verbal Reinforcement Learning”(反思机制,与记忆更新相关)
- 链接:https://arxiv.org/abs/2303.11366
Borgeaud et al., “Improving Language Models by Retrieving from Trillions of Tokens”(大规模检索增强)
- 链接:https://arxiv.org/abs/2112.04426
Khattab et al., “Dense Passage Retrieval for Open-Domain Question Answering”(稠密检索基础)
- 链接:https://arxiv.org/abs/2004.04906
7. 实验落地建议
- 先跑通 No-Memory 与 Vector-Retrieval 两个基线,确认数据与评估管线可用。
- 再逐步加入 Summary-Memory 与 Graph-Memory,对比记忆表示形式的影响。
- 中医场景建议引入专家标注的辨证金标准,并让中医师参与人工评估。
- 若资源有限,可先用模拟数据完成机制验证,再申请真实脱敏数据做最终实验。
8. 总结
Agent 的 Memory 科研可从存储、写入、检索、评估四个环节切入,中医诊断场景提供了长期性、多模态、领域知识丰富的天然实验场。通过设计清晰的对比实验与消融实验,并借助上述参考文献,可以形成完整且可复现的研究闭环。