news 2026/9/29 17:54:38

AI“组织记忆“背后的工程秘密:Clowder AI 记忆与证据系统架构全解

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI“组织记忆“背后的工程秘密:Clowder AI 记忆与证据系统架构全解

AI"组织记忆"背后的工程秘密:Clowder AI 记忆与证据系统架构全解

【免费下载链接】clowder-aiBuild AI teams, not just agents. Hard rails, soft power, shared mission.项目地址: https://gitcode.com/gh_mirrors/cl/clowder-ai

Clowder AI 是一款"打造 AI 团队而非单个 Agent"的协作平台,它的核心难题是:如何让多只 AI 猫跨越每一次会话,可靠地记住、找回并修正团队共同经历?本文带你快速看懂 Clowder AI 的记忆与证据系统架构——它不是"把旧聊天塞进 prompt"的简单 RAG,而是一套由证据层、写入车道、召回管线与治理闭环组成的 AI 记忆系统,用严格的权力边界回答了"什么值得被记住、谁有权定义真相、错了怎样撤回"三个问题。

为什么 AI 团队需要一个"记忆系统",而不只是数据库

对新手来说,最容易踩的直觉是:既然有向量数据库,把历史消息全部存进去、再自动摘要塞回上下文,不就有记忆了吗?Clowder AI 给出的答案是否定的,原因有三:

  1. 每次会话都是"新生":每个 AI Agent 醒来时上下文是空的,跨会话的沉淀必须活在模型之外;
  2. 自动摘要会"提前取舍":建索引时并不知道未来会查什么,总结者认为不重要的,恰恰可能是将来最需要找的;
  3. 多猫共写会失真:一只猫的检索结果对另一只猫只是二手证据,没有来源链和治理,记忆会随转手衰减。

于是 Clowder AI 把记忆系统定义为一个"器官"而非"工具箱":把每次协作、犯错、纠正,转化为下一次更好的在场。完整的设计哲学见 docs/architecture/memory-philosophy.md,系统全景见 docs/architecture/memory-system-overview.md。

全景图:一栋六层楼、两个方向、三条横切

理解整套架构最快的方式,是把记忆系统想象成一栋六层楼:

  • ① 证据层:保存原文、原件与来源坐标,是整栋楼的地基;
  • ② 导航层:索引、别名、实体图,告诉猫"去哪里找",但导航产物可重建、不拥有内容;
  • ③ 读取层:猫按任务主动搜索、下钻、回到原文;
  • ④ 写入层:人物、品味、画像、事件、日记等多条"车道",各有自己的治理规则;
  • ⑤ 主动性层:系统在合适的时机敲门,让猫做"要不要写、要不要想起"的判断;
  • ⑥ 治理层:批准、纠正、遗忘、权限收窄,并且必须向所有派生读面传播。

左右两个金色箭头就是两个方向:左侧"怎样留下来"(写入),右侧"怎样想起来"(召回)。三条横切线(呈现/连续性、结果证据、猫自己的行动)贯穿全部楼层。这套"六层大厦 + 八个端到端模块 + 九个观察面"的多视图导航地图,登记在 docs/architecture/memory/README.md,是记忆架构的官方导航入口。

证据层:先保住原文,索引不是真相

证据层回答一个问题:事情到底发生过吗?它做三件事:

  • 保存原始载荷:对话消息、文档、ADR、任务产物都保留原文,而不是只留摘要;
  • 记录坐标与权限:每条证据带来源坐标(在哪个 thread、哪条消息)、owner/scope/ACL 与 revision 版本;
  • 明确拒绝自动裁决:证据层不自动认定"最终真相"——图中那条打叉的虚线就是在强调这一点。

工程上,这一层由 F102 落地:所有证据存进本地 SQLite 数据库evidence.sqlite,配合 SQLite FTS5 全文索引与 sqlite-vec 向量近邻检索,全部本地运行、不依赖外部搜索服务,实现代码位于 packages/api/src/domains/memory/,设计文档见 docs/features/F102-memory-adapter-refactor.md。

💡 关键观念:索引是可重建的导航,不是真相本身。索引丢了可以重建;但如果一开始只存了摘要,真相就永远找不回来了。

读取层:一条查询要穿过的 14 层检索管线

当猫主动搜索时,一条 query 会经历"多策略召回 → 多信号融合 → 多维度重排 → 输出可行动证据"的完整管线,官方称之为 14 层检索架构:

  • 召回:实体别名解析(知道 "Ragdoll" 和内部标识是同一只猫)、BM25 全文检索、长查询逐级放松、语义向量近邻检索多路并行;
  • 融合:用 RRF(倒数排名融合)把量纲不同的多路结果合成统一排名,中文查询还会给语义路加权;
  • 重排:权威度提升、基于真实使用行为的学习排序、时效衰减、宪法级文档免降权、MMR 去重等;
  • 输出:不只是摘要片段,还给出来源引用、命中理由、可继续下钻的"证据信封"——猫可以一键打开原文窗口。

注意图中右下角的那只猫:检索只给证据候选,判断仍由猫完成。这正是该系统与"自动塞 prompt"方案最本质的区别。完整 14 层逐层解析见 docs/architecture/retrieval-pipeline-deep-dive.md。

主动性层:系统敲门,猫做判断

记忆系统最容易失败的环节是"该想起的时候没想起"。Clowder AI 的设计很克制:

  • 机械 detector 只报告事实(例如"任务完成了""出现了人物线索""某条记忆被纠正了"),从不判断重要性;
  • 命中的机械事实生成两类有界机会:WriteOpportunity(要不要写?)与RecallOpportunity(要不要想起?);
  • 猫必须明确给出三选一处置:propose(提出写入)/defer(暂缓)/abstain(放弃),或者对召回线索drill(下钻)/applied(采用)/dismissed(忽略);
  • 而且零条 cue 是合法的——没有相关线索就不打扰,"宁缺毋滥"。

背后的工程骨架包括:F271 在收工和每日巡逻时主动检查"会蒸发且以后可能有用的增量"(见 docs/features/F271-pragmatic-memory-reflection.md);F287 Cue 平面只认"封闭的类型化机会目录",防止演变成开放式 RAG(见 docs/features/F287-memory-cue-plane.md 与 docs/architecture/memory-cue-source-map.md)。

治理层:成为真相,也能被撤回

一条候选记忆变成"真相"的过程,是这条流水线上权力最重的环节:

  1. 候选(Proposal)→ 车道自有治理:每条车道(品味、人物、画像、事件……)自行定义 approve / reject / not-now、来源(Provenance)、作用域(Scope)与 ACL,并不存在统一的中央审批;
  2. 进入 Canonical Truth:成为真相后拥有 revision 版本链,修改、替换、退役都有据可查;
  3. 纠错、遗忘、ACL 收窄必须级联传播:任何一条真相被纠正或遗忘,索引、摘要、卡片、cue、prompt 等所有派生读面都必须同步失效——图中右侧那组阀门就是这个传播管道。

派生视图(索引、摘要、关系卡片、缓存)被合同冻结为"永远不获得真相权力":必须携带来源引用、构造时间与权限交集,状态变为 suspect/invalidated 时只能回源重建,不允许静默使用旧数据。这保证了"任何派生物都不能绕过撤回"。

值得记住的几条"硬边界"

如果只带走一张清单,带走这五条(完整版见全景文档的"十条硬边界"):

边界人话解释
观察 ≠ 结论机械检测器只报事实,"值不值得记"必须由猫明确裁决
索引 ≠ 真相源投影可重建,缓存变快不能换来 authority
线索 ≠ 欲望系统浮现线索,只有猫能把 cue 采纳为自己的意图与行动
遗忘是权利,不是缺陷遗忘 = "不该被找到的找不到"(合法);幽灵 = "该被找到的找不到"(缺陷)
呈现不提升权限记忆被展示、被打开、被采用、帮助了结果,是四种不同层级的证据,不能互相代证

动手深挖:推荐阅读顺序与源码入口

想从本文继续深入,建议按这条路径阅读官方文档:

  1. 设计原则(公理与定律):docs/architecture/memory-philosophy.md
  2. 系统全景与闭环账本:docs/architecture/memory-system-overview.md
  3. 一次搜索的完整管线:docs/architecture/retrieval-pipeline-deep-dive.md
  4. 逐层正式图集(九张图):docs/architecture/memory/memory-architecture-diagrams.md
  5. 记忆架构导航 Atlas:docs/architecture/memory/README.md
  6. 核心实现源码:packages/api/src/domains/memory/

结语:它造的不是数据库,是"关系系统"

Clowder AI 的记忆与证据系统给所有做 AI Agent 团队的人提了一个醒:记忆的核心难题不是"存得多",而是"谁有权定义、错了怎样撤回"。六层楼、双方向、三横切的架构,配合"证据先于真相、线索不等于结论、派生永不夺权"的硬边界,才让一群每次醒来都是"新生"的 AI 猫,拥有了可以共同信任、共同纠错、持续成长的组织记忆。

【免费下载链接】clowder-aiBuild AI teams, not just agents. Hard rails, soft power, shared mission.项目地址: https://gitcode.com/gh_mirrors/cl/clowder-ai

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 17:53:45

后训练人人可用:两周迭代1000美元起的工程化实践

1. 后训练这件事,为什么一直是大厂的专属游戏第一次听到“两周一次迭代,1000美元起”这个说法,我的反应是:这要么是营销话术,要么背后有极其苛刻的隐藏条件。在模型训练这个圈子里待久了,你会形成一种本能—…

作者头像 李华
网站建设 2026/9/29 17:53:21

TCP/IP客户端与服务端源码实战:从socket到高并发避坑指南

简介:这份资源面向网络编程初学者与需要巩固TCP/IP基础的开发者,提供一套可直接运行的客户端与服务端通信源码,帮助理解面向连接、可靠传输的TCP协议以及IP路由机制在实际代码中的落地方式。压缩包共38个文件,约73KB,以…

作者头像 李华
网站建设 2026/9/29 17:51:38

QGIS处理CAD数据的两大核心技巧:ogr2ogr预处理与几何生成器

1. 为什么CAD数据在QGIS里总让人头疼?这俩技巧真能省下三小时QGIS处理CAD数据——尤其是DWG和DXF格式——是很多测绘、规划、市政、电力设计人员日常绕不开的活儿。但说实话,刚上手时我踩过太多坑:导入后图层乱成一锅粥,文字全变成…

作者头像 李华
网站建设 2026/9/29 17:50:24

Vue 2到Vue 3 diff算法进化:虚拟DOM如何实现最小更新?

前阵子带一位刚转 Vue 3 的同事,他抛了一个问题给我:Vue 2 和 Vue 3 的 diff 算法到底差在哪?我当时第一反应是甩一段源码链接,但转念一想,这题最友好的讲法不是从源码开始,而是从“为什么 Vue 2 本来挺好的…

作者头像 李华
网站建设 2026/9/29 17:49:45

Starnet去星点工具详解:原理、实操与深空后期工作流整合指南

如果你搜“Starnet”这个词,可能会看到两种东西:一篇发表在计算机视觉顶会上的学术论文,或者一个在天文摄影圈被叫惯了的小工具。这篇文章要聊的是后者,也就是那个让无数深空摄影爱好者直呼“真香”的去星点软件。它的用途很简单&…

作者头像 李华