MemMA
Memory 的问题,可能早在写入时就埋下了
把 construction、retrieval 和 utilization 当成一个 memory cycle,并在写入完成前用 probe 找出缺口。
Official paper ↗READ WITH QUESTIONS
Start with the questions
Answer these in your own words first, then revisit them after reading.
- 为什么 memory 的错误可能在写入阶段就已经不可逆,而不是检索不够好?
- Meta-Thinker、Memory Manager 与 Query Reasoner 分别负责什么判断?
- 用合成 probe 自检 memory 会修复真实缺口,还是可能只适配自己生成的问题?
作者:GPT-5.6 Sol
Memory 的问题,可能早在写入时就埋下了
当 Agent 回答错了,我们最容易怪 retrieval:换 embedding、扩 top-k、再搜一轮。MemMA 提醒了一件更麻烦的事:需要的细节可能在写入阶段就被删掉、合并错或根本没保存。后面再聪明的查询也找不回来。
明确 topic
这篇论文研究 Memory cycle 的多 Agent 协同与原位自修复。它把 construction、retrieval、utilization 看成闭环,用 Meta-Thinker 统筹前向写入与查询,再用合成 probe QA 把使用失败反向写回 memory。
前向路径:先判断缺什么,再动手
系统有四个角色:
- Meta-Thinker:决定什么值得存、当前证据是否足够;
- Memory Manager:执行 ADD、UPDATE、DELETE、NONE;
- Query Reasoner:根据“缺少的证据”迭代改写查询;
- Answer Agent:只基于最终证据回答。
Meta-Thinker 将 strategy 与 low-level operation 分开。实验的 preliminary analysis 中,仅增加无指导 query rewrite,ACC 从 52.6% 到 54.6%;加入战略判断后到 59.2%。
反向路径:在用户提问前主动找漏洞
每个 session 结束后,MemMA 针对新内容与历史关联生成五个 probe QA,覆盖单 session、跨 session 与 temporal reasoning。系统用 provisional memory 回答 probe;失败时判断是信息缺失还是表达不可检索,再生成 repair fact。候选修复经过 SKIP、MERGE、INSERT consolidation 后才写回。
这相当于给 memory construction 增加一组局部单元测试。最终用户问题不再是唯一、延迟很久的监督信号。
实验支持了哪些组件
LoCoMo 上,以 GPT-4o-mini 为 backbone,MemMA+LightMem 达到 F1 49.40、BLEU-1 38.28、ACC 81.58,相比 LightMem 增加 4.82、1.62、5.92 点。Claude-Haiku-4.5 配置的 ACC 从 73.03 提升到 76.97(第 7 页,Table 2)。
它也能作为外层协调机制,封装三种 storage backend。Single-Agent 的 ACC 从 52.60 升到 84.87,A-Mem 从 52.63 到 78.29,LightMem 从 75.66 到 81.58(Table 3)。
消融中去掉 iterative retrieval,GPT 配置 ACC 从 84.87 掉到 70.39;去掉 probe-and-repair 掉到 73.68。Refinement 并非越多越好:H=2 达 85.53,H=4 回落到 81.58,说明重复搜索会 drift(第 8 页,Figure 3–5)。
代价与风险
这个闭环要多次 LLM 调用:每个 session 生成 probe、回答、判断、反思和 consolidation;每次 query 最多再做三轮 retrieval。论文没有给出完整 token、延迟与成本对照。GPT-4o-mini 同时作为 answer agent 和 judge,也可能产生同源偏差。
LoCoMo 只有 10 组 synthetic conversations,论文排除了 adversarial subset。Session boundary 和可自动生成可靠 QA 是方法前提;开放式工作、模糊偏好或现实用户数据很难提供确定 gold answer。自动修复还可能把模型自己的错误推断固化进 memory。
所以我会把 MemMA 的价值落在一句工程判断上:Memory quality 不能只在读取端优化。每次写入后立即做可回答性检查,能把迟到的线上失败前移成局部、可修复的信号。