← Paper StudyMemMA.md
Context & MemorySelf-improvement & Agent RL

MemMA

Memory 的问题,可能早在写入时就埋下了

把 construction、retrieval 和 utilization 当成一个 memory cycle,并在写入完成前用 probe 找出缺口。

Paper
MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution
Published
2026-03-19
Authors
Minhua Lin, Zhiwei Zhang, Hanqing Lu, Hui Liu, Xianfeng Tang, Qi He, Xiang Zhang, Suhang Wang
Official paper ↗

READ WITH QUESTIONS

Start with the questions

Answer these in your own words first, then revisit them after reading.

  1. 为什么 memory 的错误可能在写入阶段就已经不可逆,而不是检索不够好?
  2. Meta-Thinker、Memory Manager 与 Query Reasoner 分别负责什么判断?
  3. 用合成 probe 自检 memory 会修复真实缺口,还是可能只适配自己生成的问题?
Deep read

作者:GPT-5.6 Sol

Memory 的问题,可能早在写入时就埋下了

当 Agent 回答错了,我们最容易怪 retrieval:换 embedding、扩 top-k、再搜一轮。MemMA 提醒了一件更麻烦的事:需要的细节可能在写入阶段就被删掉、合并错或根本没保存。后面再聪明的查询也找不回来。

明确 topic

这篇论文研究 Memory cycle 的多 Agent 协同与原位自修复。它把 construction、retrieval、utilization 看成闭环,用 Meta-Thinker 统筹前向写入与查询,再用合成 probe QA 把使用失败反向写回 memory。

前向路径:先判断缺什么,再动手

系统有四个角色:

  • Meta-Thinker:决定什么值得存、当前证据是否足够;
  • Memory Manager:执行 ADD、UPDATE、DELETE、NONE;
  • Query Reasoner:根据“缺少的证据”迭代改写查询;
  • Answer Agent:只基于最终证据回答。

Meta-Thinker 将 strategy 与 low-level operation 分开。实验的 preliminary analysis 中,仅增加无指导 query rewrite,ACC 从 52.6% 到 54.6%;加入战略判断后到 59.2%。

反向路径:在用户提问前主动找漏洞

每个 session 结束后,MemMA 针对新内容与历史关联生成五个 probe QA,覆盖单 session、跨 session 与 temporal reasoning。系统用 provisional memory 回答 probe;失败时判断是信息缺失还是表达不可检索,再生成 repair fact。候选修复经过 SKIP、MERGE、INSERT consolidation 后才写回。

这相当于给 memory construction 增加一组局部单元测试。最终用户问题不再是唯一、延迟很久的监督信号。

实验支持了哪些组件

LoCoMo 上,以 GPT-4o-mini 为 backbone,MemMA+LightMem 达到 F1 49.40、BLEU-1 38.28、ACC 81.58,相比 LightMem 增加 4.82、1.62、5.92 点。Claude-Haiku-4.5 配置的 ACC 从 73.03 提升到 76.97(第 7 页,Table 2)。

它也能作为外层协调机制,封装三种 storage backend。Single-Agent 的 ACC 从 52.60 升到 84.87,A-Mem 从 52.63 到 78.29,LightMem 从 75.66 到 81.58(Table 3)。

消融中去掉 iterative retrieval,GPT 配置 ACC 从 84.87 掉到 70.39;去掉 probe-and-repair 掉到 73.68。Refinement 并非越多越好:H=2 达 85.53,H=4 回落到 81.58,说明重复搜索会 drift(第 8 页,Figure 3–5)。

代价与风险

这个闭环要多次 LLM 调用:每个 session 生成 probe、回答、判断、反思和 consolidation;每次 query 最多再做三轮 retrieval。论文没有给出完整 token、延迟与成本对照。GPT-4o-mini 同时作为 answer agent 和 judge,也可能产生同源偏差。

LoCoMo 只有 10 组 synthetic conversations,论文排除了 adversarial subset。Session boundary 和可自动生成可靠 QA 是方法前提;开放式工作、模糊偏好或现实用户数据很难提供确定 gold answer。自动修复还可能把模型自己的错误推断固化进 memory。

所以我会把 MemMA 的价值落在一句工程判断上:Memory quality 不能只在读取端优化。每次写入后立即做可回答性检查,能把迟到的线上失败前移成局部、可修复的信号。