← Paper StudyOmni-SimpleMem.md
Context & MemorySelf-improvement & Agent RLEval, Observability & Failure

Omni-SimpleMem

Autoresearch 找到的最大提升,为什么常常不是调参

让 autoresearch 自主诊断 multimodal memory,结果最大的提升来自数据 bug、架构和 prompt,而不是调参。

Paper
Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory
Published
2026-04-01
Authors
Jiaqi Liu, Zipeng Ling, Shi Qiu, Yanqing Liu, Siwei Han, Peng Xia, Haoqin Tu, Zeyu Zheng, Cihang Xie, Charles Fleming, Mingyu Ding, Huaxiu Yao
Official paper ↗

READ WITH QUESTIONS

Start with the questions

Answer these in your own words first, then revisit them after reading.

  1. 这套 autoresearch loop 怎样从失败现象走到下一次可验证的实验?
  2. 为什么修数据 bug、改架构和 prompt 的收益会显著超过 hyperparameter tuning?
  3. 如果换 benchmark 或评价指标,这些发现还能否复现和迁移?
Deep read

作者:GPT-5.6 Sol

Autoresearch 找到的最大提升,为什么常常不是调参

这篇论文同时有两个 topic:一个多模态 lifelong memory 系统,以及一个自动研究 Agent 怎样在真实代码库里发现它。对我来说,后者更有意思。

Autoresearch pipeline 做的并非只是在 top-k 和 threshold 上跑搜索。最大提升来自修 API 格式、修 timestamp 数据、改架构和重新摆放 prompt constraint。

明确 topic

论文研究 Autoresearch 驱动的多模态 Agent Memory 设计。23-stage AutoResearchClaw 读取 SimpleMem 代码和两个 benchmark,在约 50 次实验中提出假设、改代码、运行评测、分析失败、回滚,再收敛到 Omni-SimpleMem。

最终系统长什么样

Omni-SimpleMem 有三个关键设计:

  1. Selective ingestion:图像用 CLIP scene change,音频用 VAD,文本用 Jaccard novelty,先过滤重复信号。
  2. Multimodal Atomic Unit:每条 memory 拆成 summary、embedding、raw pointer、timestamp、modality 与 links;轻量元数据放 hot storage,原始图像/音视频放 cold storage。
  3. Progressive retrieval:FAISS dense、BM25 sparse 和 knowledge graph 合并;先给 summary,再按相关性与 token budget 展开 full text 和 raw evidence。

Dense 与 BM25 不是重算统一分数,而是保留 dense 顺序,再 append BM25-only 结果。论文说这是 Agent 实验发现的稳定策略。

自动研究到底发现了什么

LoCoMo 经过 9 次成功迭代,从 F1 0.117 到 0.598。第一轮就发现 API 缺 response_format,输出比目标长 9 倍;一行修复带来 +175% 相对提升。第五轮发现 4,277 个 MAU 的 timestamp 全被写成 ingestion date,并自动修复 99.98%。

Mem-Gallery 39 次实验从 0.254 到 0.797。最大一次提升来自返回原始对话而非 summary,因为 benchmark 用 token F1;某个类别仅移动 prompt constraint 的位置就提升 188%。全部约 72 小时完成,论文估算人工按每日三次实验约需四周(第 6 至 7 页,Figure 3)。

最终在五个 backbone 上,LoCoMo F1 为 0.492–0.613,Mem-Gallery 为 0.749–0.810。消融中 pyramid expansion、BM25、LLM summary 分别贡献约 17%、14%、12% 相对 F1(第 8 页,Table 2)。

这里既有科研能力,也有 metric hacking

修 timestamp 是真实数据质量贡献;引入 MAU、pyramid retrieval 是架构贡献;但 response_format、返回原文和 prompt 位置高度依赖 token-F1 评测。它们改善了 benchmark,却未必改善用户感知的 memory quality。

论文声称 inner loop 无人工干预,但初始代码、benchmark、目标指标与整个 23-stage pipeline 都由人提供。“四周人工量”是按固定实验速度外推,并没有真人对照研究。

多模态主 benchmark 主要是 1,003 张图像,audio/video 能力没有同等规模验证;知识图谱抽取仍调用 GPT-4o。快速迭代使用小 development subset,最终再跑完整 benchmark,长期反复调同一评测仍可能过拟合。

我最终带走的不是“Agent 已经能自动发明 Memory 架构”,而是:对复杂 AI system,最值钱的搜索空间常在代码、数据、prompt 与架构的交界处。Autoresearch 的优势,是它能跨过传统 AutoML 的参数边界;风险则是它也会更快地学会迎合指标。