← 科研空间 首页
arXiv:2605.18421v2 retrieved 2026-06-28 cs.CL / cs.AI / cs.LG

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

这篇论文不是提出新的 memory algorithm,而是把 agent memory 的评测对象从“能不能记住”推进到“能不能在 episode 内和 episode 间自我更新、复用、迁移”。核心结论很克制:显式 memory 有用,但还不是通用解。

原版 PDF arXiv 页面

Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li. Published on arXiv 2026-05-18; v2 updated 2026-06-15.

4memory evolution quadrants
6benchmark settings / datasets
15representative memory methods
8paper figures included

先给结论

EvoMemBench 的价值在于把“记忆”拆成了两个正交问题:记忆发生在当前任务内还是跨任务累积;记忆服务于知识回答还是服务于行动执行。这个拆法把很多 agent memory 论文里混在一起的能力拆开了。

主结论 1:长上下文仍很强。

在 InEp-Know 中,Gemini-3-Flash 的 retention 与 revision rank 都是 1.00。只要原始证据能放进上下文,直接保留证据常常比先压缩成外部 memory 更稳。

主结论 2:memory 的收益有条件。

InEp-Exec 中,最优 memory 方法相对 DeepSeek-V3.2 的 overall success rate 提升在 16K / 32K 最大,分别是 +14.5 / +14.0 points;到 64K / 128K 变成 +7.8 / +8.5 points。

主结论 3:难题更需要 memory,但简单题可能被 memory 拖累。

CrossEp-Know 的 easy split 上,DeepSeek-V3.2 overall 为 52.1,最佳 memory 方法 Qwen3-Emb-4B 也只有 50.0;hard split 上,DeepSeek-V3.2 是 0.0,而 ACE 到 13.0。

主结论 4:没有一种 memory 形态通吃。

Tool Using 偏 retrieval-augmented memory,Web Search 偏 general long-term memory,Embodied AI 偏 procedural long-term memory。迁移是否有效,取决于存下来的经验是否匹配目标决策过程。

研究动机

现在很多 LLM agent benchmark 评的是 reasoning、planning、tool execution,但 agent 真正在长程任务里能否工作,很大一部分取决于它怎么维护状态:哪些事实要保留,哪些旧信息要覆盖,哪些中间结果不能丢,哪些过去经验可以迁移到下一次任务。

论文把这件事称为 self-evolving memory:memory 不是静态缓存,而是在交互过程中不断更新、组织和复用的信息结构。这个视角比“向量库检索是否命中”更接近 agent 的真实失败模式。

Figure 1.
Figure 1. 论文总览图,展示 EvoMemBench 将 agent memory 拆成 in-episode / cross-episode 与 knowledge / execution 两条轴,并给出四类评测场景。
为什么已有 benchmark 不够?

LoCoMo、LongMemEval、MemoryAgentBench 更偏 text-centric knowledge retention / retrieval;MemoryArena、Evo-Memory、StuLife、MemoryBench 更接近 agentic 或 lifelong memory,但仍没有同时覆盖 in-episode / cross-episode 与 knowledge / execution 四个象限。EvoMemBench 的目标就是把这四格都放进一个统一协议里。

数学表示及建模

论文把一个 LLM agent 看成按 episode 与 step 交互的过程。episode \(e\) 中第 \(t\) 步,agent 观察到 \(o_t^e\),已有历史 \(h_{t-1}^e\),采取动作 \(a_t^e\),收到反馈 \(y_t^e\),并维护 memory state \(m_t^e\)。

$$a_t^e \sim \pi(\cdot \mid h_{t-1}^e, o_t^e, m_t^e)$$ $$m_{t+1}^e = \mathcal{U}(m_t^e, o_t^e, a_t^e, y_t^e)$$

这两个式子很重要:第一行说 memory 是 policy 的条件之一;第二行说 memory update 本身是一个函数。评测 agent memory,不能只看最终答对没答对,还要问 memory update 是否保留了正确证据、抑制了过期信息、保存了执行状态,并在之后的决策中真正被利用。

维度 定义 典型失败模式
In-episode memory 一个 episode 内维护 compact state,用于后续步骤。 历史过长后丢掉实体、参数、工具返回值或已经完成的子目标。
Cross-episode memory 跨 episode 累积 reusable information,用于后续任务。 把过于具体的旧轨迹当通用知识,或把不相关经验迁移到新环境。
Knowledge evolution 维护 facts、constraints、preferences、rules、patterns,并在冲突时更新。 能检索旧信息但不能处理 revision;旧事实污染新答案。
Execution evolution 维护 task progress、intermediate results、tool outputs、procedures。 压缩时丢 exact arguments、entity references、intermediate state。

Benchmark Construction

论文没有从零造所有任务,而是选择或重构已有数据集,目标是让任务真正依赖 memory,同时结果可验证,并覆盖不同交互形态。

Setting Dataset Source Subset / Domain / Samples
InEp-Know In-episode knowledge MemoryAgentBench Accurate Retrieval 2000; Selective Forgetting 800
InEp-Exec In-episode execution BFCL-MultiTurn-LongContext Gorilla File System 200; Vehicle Control 200; Trading Bots 200; Travel Booking 200
CrossEp-Know Cross-episode knowledge CL-Bench 120 contexts, 884 samples; split into Easy / Medium / Hard by DeepSeek-V3.2 tertiles
CrossEp-Tool Cross-episode tool use BFCL-MultiTurn-Base Four domains, 200 samples each
CrossEp-Web Cross-episode web search xbench-DeepSearch; WebWalkerQA Deep Search 100; Web QA 170
CrossEp-Emb Cross-episode embodied tasks ALFWorld Six categories: Examine in Light, Pick & Place, Clean & Place, Cool & Place, Heat & Place, Pick Two & Place

重构方式的关键点

InEp-Exec 与 CrossEp-Tool 都基于 BFCL 多轮工具任务重构。作者把含多个连续 action 的 turn 拆成更小的依赖子 turn,并把后续 turn 中本可由前文恢复的对象、ID、参数或结果改成隐式引用,例如 “the directory you created” 或 “the one we just found”。这会迫使 agent 依赖 memory 恢复状态,而不是从当前 query 直接读答案。

证据边界。

这类重构由 GPT-5-mini 辅助并经人工验证。HTML 中应把它理解为作者声明的 benchmark construction protocol,不应自动推断其完全没有重构偏差。

方法与实验协议

对照组包括 memory-free long-context LLM:Gemini-3-Flash、GPT-5-mini、DeepSeek-V3.2。Memory-augmented agent 统一使用 DeepSeek-V3.2 作为 backbone,外接不同 memory methods。

BM25 Qwen3-Emb-4B GraphRAG MemAgent MemoBrain Mem0 A-MEM MemOS MemoryOS AWM SkillWeaver AgentKB ACE ReasoningBank MemEvolve

作者把每个 memory method 包装成两个接口:utilizeupdateutilize 负责拿当前 query / state 返回相关 memory;update 负责把新观察到的信息写入 memory。

Setting Memory lifecycle Metric
InEp-Know episode 开始初始化;每个 progressive information block 后更新;episode 结束清空。 Answer accuracy
InEp-Exec episode 开始初始化;每个 interaction turn 后更新;预算为 16K、32K、64K、128K。 Success rate; token usage
CrossEp-Know 同一 context 内按 episode 顺序更新并复用;换独立 context 时 reset。 Answer accuracy
CrossEp execution 同一环境组内更新;跨环境迁移时先在 source 建 memory,再 freeze 后评估 target。 Success rate; token usage; transfer delta

实验结果

1. InEp-Know:保留比修订容易

长上下文基线在知识类 episode 内任务上非常强。Gemini-3-Flash 在 retention 与 revision 的平均 rank 都是 1.00。显式 memory 方法里,BM25、Mem0、A-MEM 在 retention 子集有相对优势,但在 FactConsolidation 这类 revision 任务上掉得明显。

Figure 2.
Figure 2. InEp-Know 上的 accuracy / cost trade-off,可用于观察长上下文基线与显式 memory 方法的成本和效果位置。
Evidence point Paper result Interpretation boundary
Gemini-3-Flash Retention avg rank 1.00; Revision avg rank 1.00; Overall rank 1.00 说明强长上下文在原始证据可直接保留时仍很难被显式 memory 超过。
BM25 Memory retention avg rank 4.25; revision avg rank 4.00 检索式 memory 对 retention 仍有竞争力,但这不等于能解决冲突更新。
Mem0 / A-MEM Mem0 retention avg rank 4.50; A-MEM retention avg rank 4.25 general long-term memory 能保留部分信息,但 revision 仍是瓶颈。

2. InEp-Exec:上下文越紧,memory 越可能有帮助

工具执行任务里,memory 的价值主要来自保住被截断或被噪声淹没的执行状态。作者报告:相对 DeepSeek-V3.2,最优 memory method 的 overall success rate 在 16K、32K、64K、128K 的提升分别是 +14.5、+14.0、+7.8、+8.5 points。

Context budget DeepSeek-V3.2 overall SR Best memory method Best memory overall SR Gain
16K 28.5 ReasoningBank 43.0 +14.5
32K 35.5 ReasoningBank 49.5 +14.0
64K 45.3 AWM 53.1 +7.8
128K 39.5 ReasoningBank 48.0 +8.5
风险点。

执行状态不是普通摘要。MemAgent 与 MemoBrain 在 16K 的 overall success rate 分别只有 26.0 与 25.0,低于 DeepSeek-V3.2 的 28.5。论文的解释是:短期压缩可能丢掉 exact tool-call arguments、entity references、intermediate results。

3. CrossEp-Know:简单题可能被 memory 污染,难题更需要 reusable knowledge

跨 episode 知识累积不是“存得越多越好”。在 easy split,当前上下文已经足够时,额外 memory 可能引入不相关证据或 prompt bias;在 hard split,memory 反而能给 backbone 提供必要的 reusable knowledge。

Split / subset No-memory baseline Best memory evidence Reading
Overall Easy DeepSeek-V3.2: 52.1 Qwen3-Emb-4B: 50.0 简单任务中显式 memory 没赢,甚至可能拖累。
Overall Hard DeepSeek-V3.2: 0.0 ACE: 13.0; BM25: 10.1; MemoryOS: 9.0 困难任务中 memory 的跨 episode 累积开始显现价值。
Rule System Application 作者强调 ACE 最稳定 ACE easy / medium / hard: 74.9 / 24.0 / 7.8 关键不是多存信息,而是形成可应用的规则性知识。

4. CrossEp execution:不同环境偏好不同 memory family

跨 episode 执行任务覆盖 Tool Using、Web Search、Embodied AI。论文报告的 family-level average rank 表明,三类执行环境偏好的 memory 形态不同。

Execution domain Best memory family among memory methods Family-level avg rank Why it fits
Tool Using Retrieval-augmented memory 5.43 相似 API call、参数填充和状态检查模式会重复出现。
Web Search General long-term memory 5.38 搜索与验证经验需要跨轨迹积累,但不能变成单一 procedure。
Embodied AI Procedural long-term memory 5.60 动作 routine、affordance 和环境交互策略更像可复用技能。
Figure 3.
Figure 3. CrossEp-Tool 的跨环境迁移热力图,图内呈现不同 source / target 工具域之间的迁移变化。
Figure 4.
Figure 4. CrossEp-Emb 的跨环境迁移热力图,图内呈现 ALFWorld 任务类型之间的迁移变化。

跨环境迁移是整篇论文最接近“memory 是否真的学到可复用经验”的部分。Tool-use 的迁移更稳定,因为不同工具域共享“检查状态、调用工具、用返回结果决定下一步、验证终态”这类流程;ALFWorld 的迁移更不稳定,因为不同任务类型的目标和可行动作差异更大。

我的评论

这篇论文最有用的地方,是把 memory benchmark 的评价单位从“记忆组件是否有提升”改成“memory 形态是否匹配任务的信息演化结构”。这个 framing 对做 self-evolving agent 很关键,因为 agent 的失败经常不是没有存东西,而是存下来的东西不能在正确时机被更新、压缩、迁移、抑制。

但它也有几个边界需要带着看:

One More Thing

我会把这篇论文抽象成一句话:memory 是一种受控信息压缩与迁移机制,评测它必须同时看 fidelity、update、selection 与 transfer alignment。

如果用这篇论文指导下一步研究,我会补两个诊断维度:

  1. Memory attribution test:要求 agent 标注本轮行动依赖了哪条 memory,并检查这条 memory 是否真的必要、是否过期、是否来自同类任务。
  2. Counter-memory stress test:给 memory 注入相似但错误的旧经验,测试方法能否拒绝或降权不匹配经验。这个比普通 accuracy 更能暴露 cross-episode memory 的安全边界。

Reference / Evidence