← Paper StudyMemanto.md
Context & MemoryCost, Reliability & Governance

Memanto

Agent Memory 需要知识图谱吗

用 typed semantic memory 和信息论检索挑战“长期记忆一定需要重型知识图谱”的默认假设。

Paper
Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon Agents
Published
2026-04-23
Authors
Seyed Moein Abtahi, Rasa Rahnema, Hetkumar Patel, Neel Patel, Majid Fekri, Tara Khani
Official paper ↗

READ WITH QUESTIONS

Start with the questions

Answer these in your own words first, then revisit them after reading.

  1. Memanto 省掉了知识图谱里的哪些组件,又保留了哪些结构信息?
  2. 信息增益或熵怎样影响 retrieval,而不只是依赖 embedding 相似度?
  3. 更轻的架构在什么任务上可能够用,在哪些复杂关系上可能失效?
Deep read

作者:GPT-5.6 Sol

Agent Memory 需要知识图谱吗

Memanto 直接挑战了一个正在变成行业惯性的设计:高质量 Agent memory 是否一定要用 vector database 加 knowledge graph,再叠多轮 LLM extraction 与 reflection?

它的答案很明确:先把 semantic retrieval 做好,再加类型、冲突与时间治理,可能比复杂图结构更划算。

明确 topic

这篇论文研究 面向长时程 Agent 的 typed semantic memory。系统使用 13 类记忆、冲突处理、非破坏式 temporal versioning 和 Moorcheh Information Theoretic Search,以单次向量检索替代图数据库与多轮 query。

Memory Tax 是什么

论文把 hybrid memory 的代价概括为 Memory Tax:

  • 写入时用 LLM 抽实体、关系和摘要;
  • 同时维护 vector 与 graph 两套基础设施;
  • 查询时做多轮改写、图遍历和 reflection;
  • 新数据需要索引,写入后不能立即查询。

Memanto 的 memory 类型包括 fact、preference、decision、commitment、goal、event、instruction、relationship、context、learning、observation、error 和 artifact。每类有不同优先级与衰减语义。新事实与旧事实冲突时,可 supersede、retain 或 annotate;旧版本仍保留,支持 as-of、changed-since 与 current-only 查询(第 5 页,Table II)。

实验里真正起主要作用的是什么

五阶段消融很有意思。最初 top-10、threshold 0.15、Claude Sonnet 4 时,LongMemEval 只有 56.6%,LoCoMo 76.2%。把 retrieval 扩到 40 条并降低阈值,分别增加 20.4 和 6.6 点;继续扩到最多 100 条,又增加 5.8 和 3.4 点。Prompt 优化只贡献 2.2 和 0.1 点。

最终换成 Gemini 3 后达到 LongMemEval 89.8%、LoCoMo 87.1%(第 8 页)。论文最有证据支撑的结论其实是:这些 benchmark 上,recall 比 retrieval precision 更重要,强模型可以在较多噪声中自行筛选。

需要注意,Hindsight 用多查询和 reflection 得到 91.4% / 89.6%,仍高于 Memanto;Memanto 的优势是单查询和较低复杂度,而非绝对最高精度(第 9 页,Table IX)。

我对生产价值的判断

类型、provenance、conflict 与版本是生产 memory 的必要治理面。它们往往比是否使用图数据库更重要。Memanto 报告 sub-10 ms ingestion、sub-90 ms retrieval,并估算每个 Agent 每日 10K memory operations 的成本为 0.50 美元。

但 Moorcheh 是作者所属公司的专有后端,吞吐、成本和“zero indexing”主要来自作者报告,尚缺少独立复现。最终分数使用 Gemini 3,其中仅模型升级就在 LongMemEval 贡献 4.8 点。附录还说明 benchmark 运行中的类型由人工选择,这与正文的 automatic typing 叙述存在实施差距。

两个 benchmark 都是对话 QA,没有测试 coding、research agent 或多 Agent 共享;论文自己估计标签噪声约为 5% 与 6%–7%。冲突处理虽是核心卖点,却没有被现有 benchmark 系统性检验。

所以我不会得出“图谱无用”。更稳妥的结论是:在对话记忆里,先把召回、类型、冲突和版本做好;只有当关系遍历带来可测增益时,再支付知识图谱的工程成本。