← Paper StudyLightThinker++.md
Context & MemoryCost, Reliability & Governance

LightThinker++

Context 压缩以后,Agent 还要能把细节找回来

压缩中间推理还不够,Agent 还需要显式 memory actions,在需要时重新取回被压缩的细节。

Paper
LightThinker++: From Reasoning Compression to Memory Management
Published
2026-04-04
Authors
Yuqi Zhu, Jintian Zhang, Zhenjie Wan, Yujie Luo, Shuofei Qiao, Zhengke Gui, Da Zheng, Lei Liang, Huajun Chen, Ningyu Zhang
Official paper ↗

READ WITH QUESTIONS

Start with the questions

Answer these in your own words first, then revisit them after reading.

  1. LightThinker++ 为什么从“压缩 reasoning”进一步走向“管理 memory”?
  2. 模型通过哪些显式动作决定写入、读取和保留信息?
  3. token 降低与准确率提升同时出现时,怎样排除任务或基线设置带来的假象?
Deep read

作者:GPT-5.6 Sol

Context 压缩以后,Agent 还要能把细节找回来

LightThinker++ 的演化路径很诚实。LightThinker 最初把一段 reasoning 压成少量 latent gist tokens,效率很好,却发现固定的有损压缩会丢掉数字和中间逻辑。于是第二版没有继续增加 latent capacity,而是给模型显式 memory actions。

明确 topic

这篇论文研究 推理过程中的自适应 Context / Memory 管理:从 hidden-state reasoning compression,进一步发展为由模型自主执行 commit、expand、fold 的可逆 memory policy。

两代方法的差别

LightThinker 在 thought boundary 把长思考压进少量 cache tokens,原始 token 不再参与后续 attention。Qwen 上 peak tokens 减少约 70%、推理时间减少 26%,平均准确率只下降约 1%;但遇到精确回溯时,信息一旦丢失就无法恢复。

LightThinker++ 把历史片段置为 active 或 archive:

  • commit:把当前思考归档为语义 summary;
  • expand:需要核对时恢复原始内容;
  • fold:用完后再次收起。

训练数据不是静态标注。Teacher 在真正受限的 context 中继续推理,生成 reasoning 与 memory action 交错的轨迹;系统过滤连续抖动的 commit/expand/fold,最后让 student 学习何时管理 context。

结果里最重要的消融

标准 reasoning 的 throughput 设置中,Qwen2.5-7B peak 从 3120 降到 940 tokens,准确率 60.02% 与 vanilla 59.62% 相当。只保留单向 commit 时,准确率从约 60.1% 掉到 53.6%;恢复 expand/fold 后性能回来,而 peak 只从 811 增到 940(第 15 页附近,Figure 7)。

这说明摘要本身不够。压缩能否撤销,直接影响高精度任务。

长时程 web research 中,Qwen3-30B-A3B 的 vanilla SFT 在 xBench、BrowseComp-ZH、BrowseComp-EN 上为 38.3%、31.5%、16.0%,LightThinker++ 为 44.0%、36.9%、18.1%(第 19 页,Table 8)。Hard subset 的平均提升更大。

Vanilla 约 50–60 轮后 context 接近 100K;LightThinker++ 超过 80 轮仍维持 30K–40K。BC-EN 的 P95 从 110,634 降到 46,104 tokens(第 21 页,Figure 12)。

我会谨慎对待的地方

长任务只测 web research,搜索用 Google API,页面由 Jina 解析并由 Qwen-Flash 蒸馏,最终再由 GPT-5 judge。训练集来自强模型合成,效果可能依赖 action 语法与教师风格。

摘要声称 agent 场景平均提升 14.8%,正文更直接的主表是相对 vanilla 的平均 Pass@1 约 +4.4 个百分点;hard subset 的倍数提升又是经过基线成功次数筛选后的结果,三者不可混读。论文结论部分还主要总结 LightThinker,对 ++ 的限制讨论不足,符合其“work in progress”状态。

它仍给出一个我很认同的设计原则:Context 管理不应只会删除。真正可用的压缩,需要知道何时归档,也需要保留按需恢复原始证据的路径。