Agent 记忆 2026:分类体系之年
多年来,「agent 记忆」指的是一个向量库加一个检索器,或者一个为长对话记录做摘要的摘要器。到 2025 年底、进入 2026 年,这个领域长出了一套词汇。一篇综述给各部分命了名,一个 benchmark 说了该测什么,一批系统开始把记忆管理当作一种可学习策略,而不是存储细节。这就是我对那一年的地图。
领域地图:形态、功能、动态
Memory in the Age of AI Agents: A Survey(Hu、Liu 等,December 2025)完成了分类体系的工作,它的结构对构建者正合适:
forms token-level | parametric | latent
functions factual | experiential | working
dynamics formation | evolution | retrieval
token 级记忆活在上下文里:历史、检索到的文档。参数记忆活在权重里:模型真的变了。潜在记忆活在隐藏表示里。功能划分记忆存什么:事实、情节,以及任务局部的暂存区。动态则描述记忆随时间如何形成、演化、被检索。
这篇综述还划出了边界线:agent 记忆不是 RAG,不是上下文工程,也不是预训练语料。这条边界与我此前从模型侧写过的权重 vs 上下文问题是同一个,而它持续出现在每一场记忆设计会上。
精读:MemoryAgentBench
MemoryAgentBench(Hu、Wang、McAuley;ICLR 2026)是对分类体系的 eval 式回答。它界定了 memory agent 需要的四项能力:
- 准确的检索:正确的信息被取回。
- 测试时学习:对话中的新信息改变行为。
- 长程理解:更早的轮次在后来仍然重要。
- 选择性遗忘:过期或自相矛盾的信息不再起作用。
设计上的关键动作:把现有的长上下文数据集改造成增量式、多轮交互。记忆是随时间展开的行为,所以要在许多轮上测试它,让信息一点一点到达,而不是整本倾倒下来。实证发现令人清醒:当下的 memory agent 并没有掌握全部四项能力。
选择性遗忘是没人想构建的那一个。冲突消解意味着 agent 学到了某样东西、世界变了、旧信念必须被取代。它也是最难评测的:对于「本应忘掉 X 吗?」,真值是什么?把这一项纳入的 benchmark 押对了注。
我亲身测量过其中两项能力背后的机制。在我的第一作者 LLM 模型编辑预印本(在审;会议名刻意隐去)中,我们发现:一个在某种措辞上训练出的编辑,往往无法在另一种措辞下产出所存储的段落,即使检索每次都找到正确的编辑。这是测试时学习在最小尺度上的失败:新信息已经到达,但在新的查询形态下行为仍然没有改变。选择性遗忘是同一刚性翻转了符号:一个无法泛化越过其训练措辞的写入,同样是一个在世界变化时你无法可靠削弱的写入。
精读:Mem0
Mem0(Chhikara 等,2025)是生产形态的回答:一条提取、整合、检索的 pipeline,外加一个捕获对话元素之间关系的图变体。在 LoCoMo 长对话 benchmark 上评测——Mem0 团队自报的厂商数字——它报告称,LLM 裁判指标相比 OpenAI baseline 有 26% 的相对提升,p95 延迟低 91%,与处理完整上下文相比节省超过 90% 的 token 成本。
两条要点。extract-consolidate-retrieve 这一 pipeline 形态,如今已是产品记忆的默认架构。而成本故事就是采用故事:完整上下文是偷懒的 baseline,记忆系统在成本上以大幅优势胜过它,同时质量持平或更高。
一个坦率的提醒:这里的主打指标是 LLM 裁判。这在 2026 年的记忆 eval 中很正常,而它正是最薄弱的一环。裁判漂移正是 MemoryAgentBench 的设计所绕开的:它不是问一个裁判记忆整体上是否有效,而是把现有的长上下文数据集改造成增量式、多轮 QA,并分别给四项能力打分——许多轮上的回答准确率,而不是单次印象。
记忆管理即策略
两篇论文收敛到同一个动作:记忆管理是一个决策问题,那就端到端地训练这个决策。
MemSearcher(Yuan 等,2025)让主干 LLM 充当自己的记忆管理器。多上下文 GRPO 跨轮传播轨迹级优势,agent 保留一份紧凑的记忆,使上下文在 token 数量上几乎恒定,而不是线性增长。
Memory-as-Action(Zhang 等,2025)把工作记忆编辑框定为策略动作:删除、插入。Dynamic Context Policy Optimization 让联合优化变得可解,14B 模型追平了 16× 更大模型的准确率,同时把平均上下文长度削减了 51%。
方向很清楚:记忆是动作空间,不是存储层。一旦「保留什么」成为策略,评测问题就从检索质量转为决策质量,分类体系里的动态轴就成了产品规格。
一个 eval 驱动的记忆技术栈
一个由 eval 驱动的记忆技术栈。MemoryAgentBench 的四项能力作为回归门禁。综述的形态、功能与动态作为设计词汇,每个组件都要说清自己写入哪种形态、服务哪种功能。外加一条写入侧的归因要求:每一次记忆写入都必须能解释自己,因为无法被审计的记忆是一种负债。
来自我自己工作的笔记
我的两件作品分处形态轴的两侧。
Engram 是一个围绕信念到权重路由构建的持续学习记忆系统。事实、文档和类日程的记录留在一个可逆的 RAG 存储里。持久的信念与偏好通过 HoReN 编辑后端整合为模型权重编辑。归因演示才是重点,它按一个固定的六步协议运行:教给一个信念、把它整合进权重、在检索关闭时用探针提问、展示 retrieved == [] 而答案仍包含该信念、关掉编辑模块看着信念消失、再打开看着它回来。这是附带证明的参数记忆。这个开关从一次真实的 UI bug 中赢得了自己的加固:在空码本(k=0,尚未写入任何内容)时,开关现在会被禁用,因为否则每次点击 ON 都会 409,报「没有可启用的编辑模块」。细节在构建笔记里。
把它映射到综述上:RAG 存储是 token 级记忆,权重编辑是参数记忆,路由器是动态层,决定什么在哪里形成。这是我所知的、把权重 vs 上下文权衡落到实处的最强具体实例。
其次,我的 Hopfield 记忆重排器设计笔记。在设计笔记层面,想法是:把检索当作一个联想式、基于能量的过程。一个 Hopfield 式能量函数在候选记忆上重排原始检索列表,最终选择是最低能量构型,而不是最高余弦相似度命中。在设计术语上,它是暴力向量 top-k 与学习式重排器之间的第三个选项,挂在综述的潜在记忆线索上:联想结构存在于候选之间的相互作用中,而不只存在于候选内部。这是一次设计探索;我不为它声称任何结果。
我会关注的那个开放赌注:选择性遗忘能否获得非合成的真值——一个真正过时了的信念语料,而不是靠构造植入的矛盾。谁做出这个东西,谁就改变了记忆系统必须证明的东西。在 harness 语境里,它放在 agent 分类体系总览之下。
本文中链接的来源均已抓取并验证。