Agent Memory · 起点

智能体记忆系统

一篇面向工程师的概念深读:把"记忆"从"更大的 context"和"RAG 检索"里拆出来,讲清它作为写入→治理→读取闭环的机制、架构与落地。基于公开资料与论文,截至 2026-06;不含可运行代码进阶,重在建立可迁移的心智模型。阅读时间约半天。

·适合谁

三条前置能力,缺一条会读得吃力:

前置知识

  • 能讲清 RAG 的检索流程:query 向量化 → 近邻搜索 → 把命中文档拼进 prompt(本教程会反复拿 RAG 当对照)。
  • 用过至少一种向量库(pgvector / Milvus / Chroma 之类),知道 embedding 与近邻检索的代价在哪。
  • 写过多轮对话或带工具调用的 agent,撞过 context window 被填满、模型"忘了前面说什么"的情况。

·不适合谁

以下读者建议先去别处:

  • 还不清楚 embedding / 近邻检索是什么 —— 先读向量库与 RAG 的入门教程,再回来。
  • 只想要一段"接入 Mem0 的代码" —— 直接看 Mem0 官方文档 的 quickstart 更快;本教程讲的是它背后的设计取舍,不是 API 调用。
  • 想要一篇可运行代码逐行进阶的 hands-on —— 本教程是概念深读(4 个内容章 + 自测),不含 worked→partial→open 的代码三阶。

·读完之后你能做到什么

记忆系统的工程难点不在"存",在"治理":写入时的冲突消解、检索时的 distractor 抑制、遗忘策略,决定了记忆是资产还是负债;而 RAG 只解决了其中"读取"那一步。读完这篇,面对一个 agent 的记忆需求,具体能做到:

  • 判别一个需求到底要的是"更长 context""一次 RAG 检索"还是"一套带写入路径的记忆系统",并说出依据。
  • 把任意记忆功能拆进 CoALA 的四类记忆(working / episodic / semantic / procedural),指出它落在哪一类。
  • 沿"写入→存储→检索→遗忘→上下文治理"五个环节,定位一个记忆系统的瓶颈与失败模式出在哪一环。
  • 就"记忆状态归谁所有"(app / 框架 / 厂商)做出选型,并说清每种归属的代价。
  • 在 Mem0 / Letta / Zep / LangMem / Cognee 与厂商原生方案之间,按场景给出选型判据;识别记忆投毒、陈旧矛盾、检索漂移等六类失败模式。

一句话本质

记忆不是更大的 context,也不是 RAG 检索;它是 agent 自己掌控的「写入 → 治理 → 读取」闭环。真正的分界线是那条 agent 自主决定"记什么 / 改什么 / 忘什么"的写入路径——这正是 RAG 没有的。

配套的架构视角:MemGPT 把记忆做成 OS 式分层——in-context 像内存、external 像磁盘,靠"分页"在两层间搬运数据。整篇教程都挂在这两条上。

现状速览 · 截至 2026-06

已是定论:记忆 ≠ 长上下文(BEAM 基准 ICLR 2026 证明差距随 token 数增大);CoALA 四类记忆与生命周期框架稳定(综述 arXiv 2512.13564, 2025-12);"选择性抽取 + 多信号检索"胜过"全塞进一个向量库"(Mem0, 2025-04);文件即记忆(Letta 2025-08、Anthropic memory tool 2025-09)。

仍在快速变化:procedural / skill memory 是 2026 最活跃前沿(MemSkill 2026-02);sleeptime 后台巩固产品化(Letta 2025–26);时序知识图谱(Zep/Graphiti 2025-01);厂商原生 memory(Anthropic Memory for Agents 2026-04、Gemini Memory Bank、OpenAI Conversations)。

已被取代:把无限长 context 当记忆替代品(LongMemEval 上掉 30%);用 NIAH / RULER 当记忆基准——它们测的是"容量"不是"连续性",新标杆是 BEAM(1M–10M token,ICLR 2026,至今无方法饱和它)。

先打一支预防针 · 流畅感 ≠ 学会

这篇有大量"原来如此"的瞬间,而顺畅恰恰最危险。读的时候盯住三句自我话术:

「我读得很顺」—— 顺,往往只是面熟,不是学会。
「我做题很快」—— 快,往往是题型眼熟,不是真的辨析清楚。
「我没卡壳」—— 没卡,往往是没真正碰到那条会改变你判断的边界。

每章末尾的自测题、`想一想` 折叠块、以及第 05 章的辨析场景,都是用来戳破这三种假象的。先合上教程作答,再展开对照。

·概念地图

整篇教程的五个部分如何挂在一条主线上。中心是记忆的本质——一个闭环;四周是从这条主线展开的五个视角,对应五个章节。

是什么 种类 怎么流转 怎么组织 用什么实现 Agent Memory 写入 → 治理 → 读取 闭环 ① 边界:记忆 ≠ 上下文 ≠ RAG 差别 = 写入路径 ① 四类记忆 (CoALA) 工作·情景·语义·程序 ② 记忆生命周期 写·存·取·忘·治理 ③ 架构与归属 分层分页·状态归谁 ④ 框架·厂商·选型·前沿 Mem0·Letta·Zep·厂商
图 0记忆系统的五个视角都从中心那条闭环展开。注意:中心节点上"写入"排在第一位——这条 agent 自己掌控的写入路径,是它区别于 RAG(只有读取)的唯一硬边界,后面每一章都会回到它。

·怎么读:三条路径

按目的选一条,不必从头到尾匀速读:

  • 只想建立心智模型(推荐) —— 01 → 02 → 03 顺读,把闭环、机制、架构吃透;04 当作"现状参考"略读,05 自测验收。约半天。
  • 正在做记忆方案选型 —— 先读 01 的 §1.2 边界(确认你真的需要记忆而非 RAG),直奔 03 的归属轴 + 04 的框架横评与选型判据;回头补 02 的机制。
  • 要看懂/评审别人写的记忆代码 —— 02 生命周期五环节是你的检查清单,03 的分层与自编辑解释它为什么这么搭;遇到术语回 01 查。

·目录

·学完之后

这篇建立的是"记忆系统"的骨架,以下方向各自在它上面加一块:

  • RAG 深读 —— 把"读取"那一步做深(检索、rerank、混合检索);记忆的检索环节直接复用这套。
  • Agent planning / reasoning patterns —— 记忆是 ReAct 循环里"观察→反思"的存储后端;episodic memory 喂回推理。
  • 知识图谱 / 时序图 —— 给"存储"环节换上图结构,解决多跳与"当时是什么状态"。
  • 上下文工程(context engineering) —— 把"上下文治理"那一环单独做深:compaction、context editing、token 预算。
  • 记忆安全 —— 记忆投毒、PII 留存、跨用户泄漏,是把记忆系统投产前的必修课(04 章 §4.4 起头)。