news 2026/8/18 20:42:07

Agent Memory:如何将上下文怎么变成团队知识资产?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Agent Memory:如何将上下文怎么变成团队知识资产?

导读:AI失忆不是模型笨,而是无状态推理的架构特性。本文从腾讯云开源的TencentDB Agent Memory切入,拆解L0到L3四层记忆蒸馏的机制,再对比Agent Memory和阿里云ContextDB的差异,阐述Mem0、Zep、MemGPT三条业界路线。


预计阅读4分钟


01 AI失忆症:不是模型笨,是架构特性

昨天你跟AI说"我是做XX行业的,输出别带xx术语"。今天新开一个会话窗口,它照样喊"亲",照样把你的背景从头问一遍。

这可能是之前从ChatGPT到DeepSeek大语言模型的通病。

但这不能怪模型。大模型是无状态推理:每次请求进来,模型参数一模一样,它能"看见"的只有你这次塞进prompt。窗口一关,会话结束,记忆“清零”(这可能只是对用户的清零~)。

所以"AI失忆"不是bug,是设计如此。模型训练完成后不再负责记忆,记忆是通过外部机制实现的。


02 记忆在编排器里,不在模型里

2023年的MemGPT论文给过一个好比喻:把上下文窗口当内存,把外部存储当磁盘,模型像操作系统换页一样,用工具调用把信息在两者之间搬来搬去。

这个比喻点破了一件事:所谓记忆,本质是编排器在推理时拼进prompt的一串token,不是模型权重里长出来的。

落到工程上,一套记忆系统得回答四个问题:

问题答案对应能力
记什么?从原始对话里提炼什么蒸馏
放哪?用什么存储承载存储
怎么取?什么时候把哪些记忆塞回上下文检索
谁能看?记忆归谁、谁可共享治理

四件事都做对了,系统才算成立。今天分析第一件事情:蒸馏。它最容易被当成人人都会的"摘要",也最能在工程上拉开差距。


03 L0到L3:把对话提炼成四层

2026年5月14日,腾讯云数据库团队开源了TencentDB Agent Memory(MIT协议,商用免费),这是一款**可插拔的、开源优先的记忆引擎,**提供自动写入、分层沉淀、按需召回与治理增强等核心能力,支撑智能体在跨会话、长周期场景中持续沉淀业务知识,到8月初已获得约1.2万星。

Agent Memory不是直接把聊天记录原样丢进向量库,而是对上下文数据原始对话逐层提炼成四层记忆。

  • L0 Conversation(原始对话):每轮对话原样保留,全量留痕。价值在于溯源。上层记忆出问题时,L0是唯一的兜底。
  • L1 Atom(原子事实):自动抽取独立的事实陈述——“用户擅长python”“用户不喜欢吃香菜”“公司做外贸的”。一条事实一张结构化卡片,能单独检索,也能单独改。
  • L2 Scenario(场景知识):把原子事实按项目/任务聚类,形成场景化的知识单元。办公归办公,写代码归写代码,不串场。
  • L3 Persona(长期认知):跨场景沉淀的稳定画像——“你是谁、习惯怎么协作”。新会话直接注入这一层,用户不用重新自我介绍。

这里面有三个细节。

  1. 每升一层,都是一次LLM调用。L0到L1是事实抽取,L1到L2是场景组织,L2到L3是人格抽象,每一跳都要模型"读旧写新"。所以管线是异步跑的——对话结束,后台慢慢蒸馏,不让用户等。代价是记忆有滞后:刚聊完的事,可能要几分钟才出现在L1里。
  2. 低层留证据,高层留结构。L0/L1存数据库(SQLite,检索稳定),L2/L3存Markdown(人能直接读、直接改)。高层记忆变成白盒,用户翻开就能看到模型记了什么"画像",不对就手动改。
  3. 蒸馏不是压缩。prompt压缩是把长对话浓缩成摘要,信息单向流失;蒸馏是把对话拆解成不同粒度的记忆,L0始终完整保留,各层指向不同的抽象粒度。要细节往下钻,要画像往上层取。

04 渐进式处理:什么该进prompt,什么不该

每次会话如何检索,如果把四层全塞进prompt,上下文窗口估计要爆炸。

Agent Memory的做法是渐进式揭示

  1. 会话启动,注入L2/L3。场景知识和用户画像直接进prompt,占token少,覆盖"对方是谁、在做什么项目"这类高频上下文。用户不用重讲背景——这是"不喊亲"的直接原因。
  2. 需要细节,回退L1/L0。任务需要具体事实时,BM25关键词检索加向量语义检索双路召回,再经RRF(Reciprocal Rank Fusion)融合排序,从L1/L0里捞相关条目。全文检索管精确匹配(“SQL报错的工单”),向量管语义联想(“上次数据库迁移踩过的坑”)。
  3. 全程套预算帽。召回结果按条目数量、字符预算、查询超时三重限制封顶。记忆系统再聪明,也不能喧宾夺主,吃掉模型的主上下文。

这个设计把RAG和记忆进行分工:RAG检索静态文档(知识库、手册),记忆检索动态对话(这个人、这个项目发生过什么)。两条平行管线,各查各的,最后在prompt里汇合。


05 三条业界路线

2025到2026年,记忆赛道跑出三条成熟路线,各自关注不同的地方:

Mem0——关注"提取"。每次交互后,用LLM把对话提炼成候选事实,再用向量相似度匹配已有记忆,让LLM决定ADD(新增)、UPDATE(更新)、DELETE(删除)还是NOOP(忽略)。核心思路是有选择性:不是每句话都配成为记忆。论文中写的是在LoCoMo上比OpenAI原生记忆提升26%、token成本降90%、P95延迟降91%。

Zep/Graphiti——关注"时间"。把对话建成时序知识图谱:节点是实体(人、产品、事件),边是关系,每条边带一个有效期区间——事实从什么时候成立,到什么时候被取代。旧事实不删,只是失效保留。所以Zep能回答"客户搬家前的地址是什么"这种带时间维度的查询,扁平向量库答不了。

MemGPT/Letta——关注"自我管理"。三层结构:Core Memory常驻上下文(像内存)、Recall Memory可检索的对话历史(像磁盘缓存)、Archival Memory长期档案(像磁盘)。关键是agent自己决定记什么、翻什么——记忆检索变成agent的工具调用。

路线代表记忆模型强项代价
智能提取Mem0LLM抽取+增删改查记忆质量高、省token提取质量依赖模型
时序图谱Zep带有效期的知识图谱回答"什么时候发生/被取代"图谱基建复杂
OS式分层MemGPT/LettaCore/Recall/Archivalagent自主管理、类人元认知工具调用开销

阿里云ContextDB和腾讯云Agent Memory对比

感觉TencentDB Agent Memory更接近 MemGPT(虚拟内存/操作系统)路线。它通过“上下文卸载(Context Offloading)”技术,将完整的工具调用结果等原始信息移到外部存储,上下文只保留摘要和索引,这与MemGPT的“虚拟内存”理念一致。独特之处在于引入了“Mermaid 任务画布”,将复杂的任务流程组织成结构化的导航图,让Agent能清晰掌握任务进度和结构,弥补了单纯“卸载”可能导致的结构丢失问题。

阿里云最近公测一款ContextDB,定位为“面向Agent的上下文数据库”和“上下文供给”服务。更接近 Mem0(通用记忆存储与服务)路线。通过拆解出“事实-实体-记忆规则”的结构化方式来存储记忆,并具备向量化和图谱能力。

维度TencentDB Agent Memory阿里云 ContextDB
记什么?四类结构化资产: 1.Chat Memory:从对话提取的L0-L3四层记忆。 2.Skill:可复用的SOP。 3.Wiki:结构化知识页面。 4.CodeGraph:代码调用关系图。三类结构化记忆: 1.事实 (Fact):原子化的陈述。 2.实体 (Entity):高频出现的人/事/物。 3.记忆规则 (Memory Rule):自定义偏好。 此外还管理外部知识库**。**
放哪?分层卸载: 1.高层:Mermaid任务画布(上下文)。 2.中层:步骤摘要(JSONL)。 3.底层:原始日志/结果(外部文件系统)。 元数据存于SQLite + 本地文件**。**企业级基础设施: 1.向量数据库:存记忆内容。 2.图数据库:存实体关系。 3.对象存储:可能用于存放非结构化数据。 整体作为一个云服务托管。
怎么取?混合检索: 支持关键词(BM25)向量(Embedding)混合检索**。 Agent可主动调用检索接口。**智能检索:语义检索为主,在“事实”层做向量命中。 支持图谱推理进行复杂关系查询。
谁能看?三级细粒度权限: 1.private:仅Owner可见。 2.team:团队成员可见。 3.restricted:通过User/Role/Agent ACL精确授权。 新建记忆默认仅创建者可见。企业级三层权限: 基于“Workspace - Group - Member”模型。 共享范围可按组织边界和权限组控制。 变更需走审核流程并留有审计记录**。**

06 从个人缓存到团队资产

第一代记忆系统解决"单个Agent记住事",现在是要考虑如何让整个Agent团队的经验流通起来。

从腾讯Agent Memory看,它将能复用的信息抽象成四类资产:Chat Memory(对话沉淀)、Skill(跑通的任务流程,带版本、触发边界、验证规则)、LLM-Wiki(文档结构化)、CodeGraph(代码索引)。四类资产通过Memory Hub统一管理。

还有一个很重要的权限模型

  • 默认私有。新产生的对话记忆和Skill默认只有本人可见,共享是主动行为,不是默认暴露。
  • 细粒度ACL。能精确控制"这条记忆谁能看、谁能用",而不是公开/私有的粗暴二分。
  • 私有记忆对团队管理员也不可见。管理员能管系统,不能看你的记忆。这一条,把"治理"和"窥私"彻底分开了。

为什么强调这个?因为RAG解决不了权限问题:RAG检索的是文档,文档没有"这条知识属于谁、谁授权了使用"的语义。而记忆是Agent的行为痕迹,比文档敏感得多——里面有客户的偏好、内部的决策、未发布的产品信息。让所有Agent默认共享一切记忆,等于让团队里每个Agent都变成行走的泄密器。



最后的话

行业内记忆工程正在快速发展,每种技术方案都有优劣势。TencentDB Agent Memory的架构优势明显,但是也能发现一些问题,比如四层蒸馏会带来记忆滞后,刚聊完的事几分钟后才进L1,那么如何加快记忆更新。同时,蒸馏可能放大错误,虽然L0有原始数据,L2/L3人可读可改,但没有提如何防止不出错。

模型还会继续迭代,你认为Agent时代下,优秀的记忆系统应该是什么样?

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/18 20:31:15

公众号排版救星:排版工具 gzh-design

对于长期运营公众号的内容创作者而言,排版往往是比写作本身更令人头疼的环节。微信自带编辑器功能简陋、格式处理能力弱;第三方在线排版工具则普遍存在强制登录、广告泛滥、模板花哨、导出带冗余代码甚至隐形水印等问题。本文将深度解析一款在 Skills 市…

作者头像 李华
网站建设 2026/8/18 20:28:24

从零打造低成本四足机器人:OpenCat开源项目全解析

1. 项目概述:为什么我们需要一台“买得起”的四足机器人?如果你对机器人、电子或者编程感兴趣,可能早就被波士顿动力那些动辄几十上百万美元的机器狗视频震撼过。它们能跑能跳,甚至能后空翻,但对我们绝大多数爱好者、学…

作者头像 李华
网站建设 2026/8/18 20:24:02

ANSYS收购Optis:高保真仿真如何重塑自动驾驶研发流程

1. 从一笔收购案看仿真如何重塑自动驾驶研发 最近,仿真软件巨头ANSYS宣布以3亿美元收购光学仿真公司Optis,这消息在汽车和仿真圈里都激起了不小的水花。乍一看,这不过是又一起科技公司间的并购,但如果你正身处自动驾驶研发、汽车电…

作者头像 李华