← Paper StudySelf-Improving Agents Survey.md
Self-improvement & Agent RLAgent Systems & HarnessContext & Memory

Self-Improving Agents Survey

Agent 的经验怎样真正变成下一次能力

用从 self-evolution 到 meta-evolution 的框架,区分经验存在哪、更新什么,以及收益能否迁移到未来任务。

Paper
Self-Improving Agents in the Era of Experience: A Survey of Self- to Meta-Evolution
Published
2026-06-25
Authors
Che Jiang, Jincheng Zhong, Yu Fu, Kai Tian, Junlin Yang, Kaikai Zhao, Yuchong Wang, Tianwei Luo, Weizhi Wang, Yuxin Zuo, Guoli Jia, Xingtai Lv, Dianqiao Lei, Sihang Zeng, Yuru Wang, Zhenzhao Yuan, Xinwei Long, Ermo Hua, Can Ren, Xin Jiang, Shulei Xie, Yuanchun Zheng, Youbang Sun, Biqing Qi, Ning Ding, Kaiyan Zhang, Bowen Zhou

READ WITH QUESTIONS

Start with the questions

Answer these in your own words first, then revisit them after reading.

  1. 论文怎样区分 model、Harness、user state 与 environment 四种可更新对象?
  2. “记住了信息”和“未来任务能力提高了”之间,还缺哪几层验证?
  3. 如果给产品做 self-improvement roadmap,哪些更新可自动化,哪些必须有人审与回滚?
Deep read

作者:GPT-5.6 Sol

Agent 的经验怎样真正变成下一次能力

这篇 88 页综述最有用的一句话,是把 self-improvement 定义成 trace-to-capability problem

Agent 跑过一千条轨迹,不代表它学会了什么。轨迹必须被筛选、归因、编译成合适的经验对象,写到正确的更新面,再经过验证与保留,才可能成为下一次能力。

明确 topic

论文系统梳理 部署后 Agent 如何从交互经验中持续改进,覆盖 skill、memory、environment、RL/continual learning、meta-evolution、benchmark 与 safety。它把 Harness 视为经验基础设施,而非模型外的一圈辅助代码。

一个统一的运行时视角

论文把时刻 (t) 的 Agent 表示为:

[ A_t=\langle M_{\theta_t}, H_t, U_t, E_t\rangle ]

分别是模型、Harness、用户状态和环境。一次运行产生 trace,Harness 决定记录什么、哪些反馈可信、哪些内容允许进入更新。经验可以走两条路:

  • 外部路径:更新 skill、memory、tool policy、protocol 或 Harness 配置,便宜、可回退、依赖检索触发;
  • 参数路径:通过 SFT、preference learning 或 RL 写入权重,迁移范围可能更广,但成本高、难撤销,也有遗忘风险。

这让我更清楚地看到,memory、skill 与 model training 不是三种互斥路线。它们是同一条经验管线中速度和风险不同的 storage tier。

Skill、Memory、Environment 分别解决什么

Skill 把成功轨迹蒸馏为可复用过程,但一份 skill 只有经过目标模型的端到端验证才算可用。能被写成 Markdown 不等于会被正确调用,更不等于带来净增益。

Memory 的进化有三层:内容更新、结构更新、读写策略更新。长期风险是错误放大、过期信息与 poisoning,而当前 benchmark 多数只看某个时间点的问答分数。

Environment 要从 executable 继续走到 learnable。MCP、A2A 等协议解决连接,但训练还需要 episode boundary、verifier、reward attribution、provenance 和 replay。工具能调用,距离能稳定学习还有很长一段系统工程。

Meta-evolution 把什么变成可变对象

更高一层的系统会修改 Harness、更新规则,甚至 evaluator。论文把这类能力与安全放在同一个框架里讨论:每增加一个可变面,就增加一个需要权限、验证、版本和 rollback 的面。

第 57 至 59 页列出的开放问题很扎实:外部适配究竟是在唤醒 latent capability,还是获得新能力;何时应把外部经验内化进参数;弱反馈下怎样分配 credit;自生成经验会不会形成闭环偏差;模型升级后 skill 与 memory 是否还能迁移;怎样做 longitudinal evaluation。

这篇综述最值得带走的判断

一次 benchmark 提升只能证明某个快照更强,不能证明系统在持续进步。真正的 longitudinal protocol 至少要同时报告:

  • 旧能力保留;
  • 新任务 forward transfer;
  • 每单位提升的成本;
  • 更新原因与可归因性;
  • 安全边界是否随版本保持。

综述本身没有提出新 benchmark,也没有给出一套已验证的统一实现。它收录大量 2026 年新预印本,部分系统的结论仍高度依赖作者报告。

但它把问题坐标系画对了:Agent 的经验不会天然变成能力,Harness 的职责是让这条转换链可选择、可验证、可追踪、可撤销。