先给结论
EvoMemBench 的价值在于把“记忆”拆成了两个正交问题:记忆发生在当前任务内还是跨任务累积;记忆服务于知识回答还是服务于行动执行。这个拆法把很多 agent memory 论文里混在一起的能力拆开了。
在 InEp-Know 中,Gemini-3-Flash 的 retention 与 revision rank 都是 1.00。只要原始证据能放进上下文,直接保留证据常常比先压缩成外部 memory 更稳。
InEp-Exec 中,最优 memory 方法相对 DeepSeek-V3.2 的 overall success rate 提升在 16K / 32K 最大,分别是 +14.5 / +14.0 points;到 64K / 128K 变成 +7.8 / +8.5 points。
CrossEp-Know 的 easy split 上,DeepSeek-V3.2 overall 为 52.1,最佳 memory 方法 Qwen3-Emb-4B 也只有 50.0;hard split 上,DeepSeek-V3.2 是 0.0,而 ACE 到 13.0。
Tool Using 偏 retrieval-augmented memory,Web Search 偏 general long-term memory,Embodied AI 偏 procedural long-term memory。迁移是否有效,取决于存下来的经验是否匹配目标决策过程。
研究动机
现在很多 LLM agent benchmark 评的是 reasoning、planning、tool execution,但 agent 真正在长程任务里能否工作,很大一部分取决于它怎么维护状态:哪些事实要保留,哪些旧信息要覆盖,哪些中间结果不能丢,哪些过去经验可以迁移到下一次任务。
论文把这件事称为 self-evolving memory:memory 不是静态缓存,而是在交互过程中不断更新、组织和复用的信息结构。这个视角比“向量库检索是否命中”更接近 agent 的真实失败模式。
LoCoMo、LongMemEval、MemoryAgentBench 更偏 text-centric knowledge retention / retrieval;MemoryArena、Evo-Memory、StuLife、MemoryBench 更接近 agentic 或 lifelong memory,但仍没有同时覆盖 in-episode / cross-episode 与 knowledge / execution 四个象限。EvoMemBench 的目标就是把这四格都放进一个统一协议里。
数学表示及建模
论文把一个 LLM agent 看成按 episode 与 step 交互的过程。episode \(e\) 中第 \(t\) 步,agent 观察到 \(o_t^e\),已有历史 \(h_{t-1}^e\),采取动作 \(a_t^e\),收到反馈 \(y_t^e\),并维护 memory state \(m_t^e\)。
这两个式子很重要:第一行说 memory 是 policy 的条件之一;第二行说 memory update 本身是一个函数。评测 agent memory,不能只看最终答对没答对,还要问 memory update 是否保留了正确证据、抑制了过期信息、保存了执行状态,并在之后的决策中真正被利用。
| 维度 | 定义 | 典型失败模式 |
|---|---|---|
| In-episode memory | 一个 episode 内维护 compact state,用于后续步骤。 | 历史过长后丢掉实体、参数、工具返回值或已经完成的子目标。 |
| Cross-episode memory | 跨 episode 累积 reusable information,用于后续任务。 | 把过于具体的旧轨迹当通用知识,或把不相关经验迁移到新环境。 |
| Knowledge evolution | 维护 facts、constraints、preferences、rules、patterns,并在冲突时更新。 | 能检索旧信息但不能处理 revision;旧事实污染新答案。 |
| Execution evolution | 维护 task progress、intermediate results、tool outputs、procedures。 | 压缩时丢 exact arguments、entity references、intermediate state。 |
Benchmark Construction
论文没有从零造所有任务,而是选择或重构已有数据集,目标是让任务真正依赖 memory,同时结果可验证,并覆盖不同交互形态。
| Setting | Dataset | Source | Subset / Domain / Samples |
|---|---|---|---|
| InEp-Know | In-episode knowledge | MemoryAgentBench | Accurate Retrieval 2000; Selective Forgetting 800 |
| InEp-Exec | In-episode execution | BFCL-MultiTurn-LongContext | Gorilla File System 200; Vehicle Control 200; Trading Bots 200; Travel Booking 200 |
| CrossEp-Know | Cross-episode knowledge | CL-Bench | 120 contexts, 884 samples; split into Easy / Medium / Hard by DeepSeek-V3.2 tertiles |
| CrossEp-Tool | Cross-episode tool use | BFCL-MultiTurn-Base | Four domains, 200 samples each |
| CrossEp-Web | Cross-episode web search | xbench-DeepSearch; WebWalkerQA | Deep Search 100; Web QA 170 |
| CrossEp-Emb | Cross-episode embodied tasks | ALFWorld | Six categories: Examine in Light, Pick & Place, Clean & Place, Cool & Place, Heat & Place, Pick Two & Place |
重构方式的关键点
InEp-Exec 与 CrossEp-Tool 都基于 BFCL 多轮工具任务重构。作者把含多个连续 action 的 turn 拆成更小的依赖子 turn,并把后续 turn 中本可由前文恢复的对象、ID、参数或结果改成隐式引用,例如 “the directory you created” 或 “the one we just found”。这会迫使 agent 依赖 memory 恢复状态,而不是从当前 query 直接读答案。
这类重构由 GPT-5-mini 辅助并经人工验证。HTML 中应把它理解为作者声明的 benchmark construction protocol,不应自动推断其完全没有重构偏差。
方法与实验协议
对照组包括 memory-free long-context LLM:Gemini-3-Flash、GPT-5-mini、DeepSeek-V3.2。Memory-augmented agent 统一使用 DeepSeek-V3.2 作为 backbone,外接不同 memory methods。
作者把每个 memory method 包装成两个接口:utilize 和
update。utilize 负责拿当前 query / state
返回相关 memory;update 负责把新观察到的信息写入 memory。
| Setting | Memory lifecycle | Metric |
|---|---|---|
| InEp-Know | episode 开始初始化;每个 progressive information block 后更新;episode 结束清空。 | Answer accuracy |
| InEp-Exec | episode 开始初始化;每个 interaction turn 后更新;预算为 16K、32K、64K、128K。 | Success rate; token usage |
| CrossEp-Know | 同一 context 内按 episode 顺序更新并复用;换独立 context 时 reset。 | Answer accuracy |
| CrossEp execution | 同一环境组内更新;跨环境迁移时先在 source 建 memory,再 freeze 后评估 target。 | Success rate; token usage; transfer delta |
实验结果
1. InEp-Know:保留比修订容易
长上下文基线在知识类 episode 内任务上非常强。Gemini-3-Flash 在 retention 与 revision 的平均 rank 都是 1.00。显式 memory 方法里,BM25、Mem0、A-MEM 在 retention 子集有相对优势,但在 FactConsolidation 这类 revision 任务上掉得明显。
| Evidence point | Paper result | Interpretation boundary |
|---|---|---|
| Gemini-3-Flash | Retention avg rank 1.00; Revision avg rank 1.00; Overall rank 1.00 | 说明强长上下文在原始证据可直接保留时仍很难被显式 memory 超过。 |
| BM25 | Memory retention avg rank 4.25; revision avg rank 4.00 | 检索式 memory 对 retention 仍有竞争力,但这不等于能解决冲突更新。 |
| Mem0 / A-MEM | Mem0 retention avg rank 4.50; A-MEM retention avg rank 4.25 | general long-term memory 能保留部分信息,但 revision 仍是瓶颈。 |
2. InEp-Exec:上下文越紧,memory 越可能有帮助
工具执行任务里,memory 的价值主要来自保住被截断或被噪声淹没的执行状态。作者报告:相对 DeepSeek-V3.2,最优 memory method 的 overall success rate 在 16K、32K、64K、128K 的提升分别是 +14.5、+14.0、+7.8、+8.5 points。
| Context budget | DeepSeek-V3.2 overall SR | Best memory method | Best memory overall SR | Gain |
|---|---|---|---|---|
| 16K | 28.5 | ReasoningBank | 43.0 | +14.5 |
| 32K | 35.5 | ReasoningBank | 49.5 | +14.0 |
| 64K | 45.3 | AWM | 53.1 | +7.8 |
| 128K | 39.5 | ReasoningBank | 48.0 | +8.5 |
执行状态不是普通摘要。MemAgent 与 MemoBrain 在 16K 的 overall success rate 分别只有 26.0 与 25.0,低于 DeepSeek-V3.2 的 28.5。论文的解释是:短期压缩可能丢掉 exact tool-call arguments、entity references、intermediate results。
3. CrossEp-Know:简单题可能被 memory 污染,难题更需要 reusable knowledge
跨 episode 知识累积不是“存得越多越好”。在 easy split,当前上下文已经足够时,额外 memory 可能引入不相关证据或 prompt bias;在 hard split,memory 反而能给 backbone 提供必要的 reusable knowledge。
| Split / subset | No-memory baseline | Best memory evidence | Reading |
|---|---|---|---|
| Overall Easy | DeepSeek-V3.2: 52.1 | Qwen3-Emb-4B: 50.0 | 简单任务中显式 memory 没赢,甚至可能拖累。 |
| Overall Hard | DeepSeek-V3.2: 0.0 | ACE: 13.0; BM25: 10.1; MemoryOS: 9.0 | 困难任务中 memory 的跨 episode 累积开始显现价值。 |
| Rule System Application | 作者强调 ACE 最稳定 | ACE easy / medium / hard: 74.9 / 24.0 / 7.8 | 关键不是多存信息,而是形成可应用的规则性知识。 |
4. CrossEp execution:不同环境偏好不同 memory family
跨 episode 执行任务覆盖 Tool Using、Web Search、Embodied AI。论文报告的 family-level average rank 表明,三类执行环境偏好的 memory 形态不同。
| Execution domain | Best memory family among memory methods | Family-level avg rank | Why it fits |
|---|---|---|---|
| Tool Using | Retrieval-augmented memory | 5.43 | 相似 API call、参数填充和状态检查模式会重复出现。 |
| Web Search | General long-term memory | 5.38 | 搜索与验证经验需要跨轨迹积累,但不能变成单一 procedure。 |
| Embodied AI | Procedural long-term memory | 5.60 | 动作 routine、affordance 和环境交互策略更像可复用技能。 |
跨环境迁移是整篇论文最接近“memory 是否真的学到可复用经验”的部分。Tool-use 的迁移更稳定,因为不同工具域共享“检查状态、调用工具、用返回结果决定下一步、验证终态”这类流程;ALFWorld 的迁移更不稳定,因为不同任务类型的目标和可行动作差异更大。
我的评论
这篇论文最有用的地方,是把 memory benchmark 的评价单位从“记忆组件是否有提升”改成“memory 形态是否匹配任务的信息演化结构”。这个 framing 对做 self-evolving agent 很关键,因为 agent 的失败经常不是没有存东西,而是存下来的东西不能在正确时机被更新、压缩、迁移、抑制。
但它也有几个边界需要带着看:
- 它是 benchmark paper,不是新算法 paper。如果你要找新的 memory architecture,这篇的贡献不是方法,而是评价坐标系与实验对照。
- 公开代码当前仍未释放细节。我核验 GitHub HEAD,README 仍只有 “Coming soon.”,所以这份 HTML 只把论文 PDF/source 与公开仓库链接作为证据,不把仓库实现当作可复现实证。
- 部分任务经过 LLM-assisted reconstruction。作者声明 GPT-5-mini 辅助并人工验证,这提升了 memory dependency,但仍可能引入重构风格偏差。
- 模型命名处在 2026 arXiv 语境。Gemini-3-Flash、GPT-5-mini、DeepSeek-V3.2 等基线应按作者声明的实验协议阅读;HTML 不额外验证这些闭源模型结果。
One More Thing
我会把这篇论文抽象成一句话:memory 是一种受控信息压缩与迁移机制,评测它必须同时看 fidelity、update、selection 与 transfer alignment。
如果用这篇论文指导下一步研究,我会补两个诊断维度:
- Memory attribution test:要求 agent 标注本轮行动依赖了哪条 memory,并检查这条 memory 是否真的必要、是否过期、是否来自同类任务。
- Counter-memory stress test:给 memory 注入相似但错误的旧经验,测试方法能否拒绝或降权不匹配经验。这个比普通 accuracy 更能暴露 cross-episode memory 的安全边界。
完整图谱 / Figure Gallery
下面补齐论文 TeX source 中发现但未放进主线叙事的 4 张附录图。主文已经包含 overview、cost-effectiveness、CrossEp-Tool heatmap 和 CrossEp-Emb heatmap。