首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Agent自进化系列(四)--Memory什么时候才算进化:从保存过去,到改善未来

Agent自进化系列(四)--Memory什么时候才算进化:从保存过去,到改善未来

原创
作者头像
languageX
修改2026-08-30 12:00:50
修改2026-08-30 12:00:50
1750
举报
文章被收录于专栏:Agent自进化Agent自进化

上一篇,我们讨论了 Agent 如何从一次任务的成败中提炼出以后还能复用的经验。

经验被提炼出来之后,下一个问题是:怎样把它留在系统里?一个最直接的答案是 Memory。

但在目前的 Agent 框架中,Memory 是一个很泛的概念。原始对话、任务轨迹、从历史中抽取的事实与经验,当前任务的上下文,都可能被被叫 Memory。只要系统保存了过去的信息,我们似乎就可以说这个Agent有记忆了。

但有记忆,不等于记忆在进化。

一条经验被写入 Memory,只能说明系统保存了过去。它能否在后续任务中被准确检索并能恰当使用,并在环境或用户需求发生变化后及时更新,才决定这段经验能不能真正转化为长期能力。

所以,记忆变多,不算进化;未来任务做得更好,才算。

本文将沿着三个问题展开:

首先,Memory 究竟保存什么,一条经验要经过哪些环节,才能在后续任务中真正发挥作用;

其次,当任务持续发生、环境不断变化时,记忆内容和管理策略应该如何调整;

最后,我们又该用什么标准验证这些变化,确实让 Agent 获得了更稳定的长期能力。

Memory 的进化并不是记忆库不断扩张,而是一个从经验准入、检索与复用,到持续更新、策略调整,再到效果验证的完整闭环。

一、Memory 不是一个装经验的盒子

很多框架把 Memory 当成一个整体:接入之后,经验有了存放的位置;效果不理想时,就会把问题统一归结为记忆能力不足。实际上,记忆系统包含非常多相互关联的模块。

经验可能在写入时就出现偏差,可能被正确保存却无法精准召回,可能被召回但存在冲突。所以,有记忆只代表系统具备了存储能力,能否发挥作用,还要看写入、检索、使用和维护是否形成闭环。

举个例子,每周生成业务报告的 Agent ,它把“日期字段需要先统一格式”写进 Memory,下周有新报表时,却可能没有检索到这条经验,也可能把它错误地用在另一种数据源上。记忆仍然存在,问题却可能发生在完全不同的环节。

Are We Ready For An Agent-Native Memory System?

从数据管理视角评估 Agent 记忆,将系统拆为抽取、表示与存储、检索与路由、维护四个模块。分模块后,再讨论记忆效果时,可以进一步定位究竟是哪一环出了问题。

抽取:从原始交互里拿出什么 表示与存储:经验以什么形式存在 检索与路由:当前任务应该调用哪些 维护:怎样合并、更新、淘汰和重组

论文通过评测给出了两点值得注意的结论:

1. 没有哪种记忆架构在所有场景中始终占优;

2. 在不少任务中,局部维护也比全局重组更具成本优势。

不同架构擅长的问题并不相同。图结构更适合处理事实改写和关系推理,复合系统在部分对话任务中表现更好;而在一些时序问题上,长上下文本身已经接近最好的记忆系统。因此,一次失败不能直接归因于Memory 架构不行,更需要判断问题出在抽取、存储、检索还是维护。

怎么维护记忆,同样也影响系统能否长期运行。只增不删,记忆库会持续积累噪声;直接删除或合并,又可能损失仍然有用的信息;过时事实被召回,可能继续影响当前判断;过时的不召回,又可能影响推理脉络。相比周期性重建整个记忆库,更可行的方向是保留每条经验的来源、版本和使用效果,在局部完成更新、降权或删除。

二、从存放到复用:一条经验的三道关

一条任务经验要在未来真正发挥作用,至少要经过三个环节:准入、选择和复用。

1. 记忆准入:成功经历也未必值得留下

还是生成业务报告例子:日期格式不统一会导致后续统计出错。它修正格式后顺利完成了任务,于是形成了一条经验——“日期字段需要先统一格式”。但一次任务成功,并不足以证明这条经验值得长期保留。真正发挥作用的可能是每次的校验,也可能只是当时任务的数据恰好满足条件。

MemGPT: Towards LLMs as Operating Systems

解决的主要问题是上下文容量:模型需要在有限上下文和外部存储之间交换信息。Mem0A-Mem 进一步改善了记忆的抽取、更新和组织方式。但在这些机制之前,还有一个更基础的问题:系统怎样判断一条候选经验是否正确、是否具有长期价值?

一条被写进去的经验,本身是对的吗?它作为经验有用吗?

长期记忆的风险不只在于遗漏信息,还在于稳定地传播错误。如果 Agent 曾经依靠一条错误策略偶然完成任务,后续遇到相似问题时,检索机制反而可能让这条路径被不断复用。

How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior

论文研究验证了这一现象:当前任务与记忆中的历史输入越相似,Agent 的输出也越容易沿用过去的模式。好的经验可以提升表现,错误经验同样会被复制。更麻烦的是,任务成功并不保证经验有效,成功可能来自偶然因素,也可能依赖当时特有的环境条件。

所以,系统可以先把经验作为候选项保存,再根据它在后续任务中的实际效果调整置信度和状态,但是这么做需要额外对照:一次成功究竟来自记忆,还是模型原本就能完成,不能仅凭单次任务结果判断。

所以在经验存储的时候,一条经验不能只有正文,最好保留来源证据、适用范围、时间、版本和历史效用等字段。而对于存储字段最好在项目初期根据需求尽可能完善。

字段

作用

缺了会怎样

content

可复用的经验内容

无法形成可读取、可调用的记忆

evidence

来源轨迹与当时的反馈

无法分辨是实证还是模型的自我解释

scope

适用的任务、环境与版本

局部经验被错误泛化

confidence

当前可信程度

强弱经验被同等对待

utility

历史调用的实际收益

无法按效果排序和淘汰

timestamp

写入时间与环境版本

环境变了也不知道该复查哪些

status

候选、有效、降级、已撤销

无法判断这条经验当前是否仍应使用

version

版本与替代关系

无法追踪变更历史,也无法可靠回滚

这些存储信息为后续的合并、冲突处理、权重更新和撤销提供了依据。

2. 检索选择:相似不等于有用

经验是否会影响行为,很大程度上取决于哪一条记忆被召回。语义相似度可以找到表面相近的任务,却不一定能找到真正有帮助的策略:描述相似的任务可能需要完全不同的处理方式,表述差异很大的任务也可能共享同一个失败原因。

Memento: Fine-tuning LLM Agents without Fine-tuning LLMs

Memento将案例选择本身做成可学习的过程。它维护一个案例库,并利用在线 Q 学习决定当前任务应该调用哪些案例,而不是固定选择语义最相似的若干条。论文中训练一个约 1.25 亿参数的任务—案例匹配模型用来选择案例。输入是当前任务和一条历史任务及其计划,输出是这条历史案例对当前任务有用的概率,用选择的案例辅助规划。

相比只保存失败反思,论文的思路是开始优化该使用哪条经验。

MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory

MemRL采用两阶段检索:先用语义相似度缩小候选范围,再根据环境反馈估计经验效用。

MemRL 为每条经验附加一个可以持续更新的效用分数。系统先按语义找相关经验,再优先选择过去真正有效的经验,并根据本次任务的结果更新它们的分数。系统中底座模型保持不变,更新发生在运行时记忆中,从而在稳定的推理能力和可调整的经验之间建立隔离。

MemRL 的两阶段检索
MemRL 的两阶段检索

所以,Memento 学习的是当前任务应该选择哪条经验的模型;MemRL 不训练模型,而是让每条经验自己积累效用值。

但是,这类效用估计存在天然限制。Agent 只能观察使用某条经验之后的结果,无法同时获得不使用它的反事实结果。一次成功可能来自记忆,也可能来自模型能力、额外推理预算或随机波动,所以需要更严格的对照实验。

3. 复用适配:找到不等于可以照搬

即使检索到了正确经验,也不能直接重放历史轨迹。新任务中的对象、约束、环境状态和验收标准可能已经改变;完整复制容易沿用过时细节,只保留摘要又可能丢失关键步骤。

Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories

Beyond Retrieval将检索之后怎样复用单独作为研究问题。论文中的两个发票任务表面相似,但客户、筛选条件、操作顺序和检查方式都发生了变化,旧轨迹只能提供过程参考,不能原样执行。

论文提出一种面向当前查询重新整理经验的方式:保留可复用过程,同时明确需要重新绑定的对象、适用条件和验证方法。重点不是压缩轨迹,而是把历史经验转换成适合当前任务的支持信息。

QCR 如何把旧经验适配到新任务
QCR 如何把旧经验适配到新任务

在 WebArena、WorkArena 和 AppWorld 的 2,391 个目标上,论文方法取得了 62.3% 的平均成功率,比直接注入完整轨迹高 10.7 个百分点,同时减少了约 48.9% 的在线 token。任务越长、前后绑定变化越大,适配环节的价值越明显。

这项工作并未解决完整的自进化问题,但它说明:记忆系统不能止步于召回,还要解决历史经验如何安全地进入当前任务。

召回 → 选择 → 适配 → 验证

因此,只看召回率只覆盖了经验复用的第一步。召回、选择、适配和验证共同完成之后,经验才算真正进入了未来行为。

从准入、检索到复用,解决的是经验如何进入后续任务。但记忆长期运行后,还会出现另一个问题:过去有效的经验可能逐渐失效,新的反馈也可能改变它的价值。

MemRL 通过更新经验效用,给出了一种最小的自我修正方式:不急于改写经验内容,而是根据后续任务的结果,调整它再次被选中的概率。更完整的记忆系统还需要处理内容修正、冲突合并、权重衰减和经验撤销。

再往前一步,问题就不只是记忆能不能修改,而是当任务、反馈和环境持续变化时,它能不能及时跟上。

三、从顺序任务到真实在线

在线并不是自进化成立的必要条件,却是记忆系统长期运行时必须面对的更强设定:任务持续到来,反馈可能延迟,经验的价值也会随时间变化。

从评测协议看,可以区分三个层次:

静态评测:历史一次性给齐,系统不必在任务之间变得更好 顺序任务:前面的经验会影响后面的任务 真实在线:任务、反馈和环境持续到来

静态评测只要求系统利用给定历史完成当前问题;顺序任务开始考察前面的经验能否改善后续任务;真实在线环境还会引入持续反馈、分布变化和经验过期。

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

将静态数据重新组织为顺序任务流,让前面的任务为后续任务提供可复用策略。每完成一个任务,系统都会经历检索、上下文合成和记忆更新。底座模型保持不变,变化发生在记忆本身。

其中一种实现把题目、做法和结果作为完整案例追加,新任务再按相似度检索;另一种实现允许 Agent 在推理过程中调用、剪枝和重组记忆,并在任务结束后把反馈写回。前者证明顺序复用本身有价值,后者进一步处理记忆质量随任务推进而变化的问题。

这类任务序列能够验证跨任务积累,但时间顺序仍由静态数据人为构造,反馈也大多是明确的对错信号。

Live-Evo: Online Evolution of Agentic Memory from Continuous Feedback

进一步指出,许多在线进化流程仍建立在固定训练集和测试集之上,只是通过重新排列静态任务来近似在线学习。面对真实的分布漂移和密集反馈的时候,这些方法可能迅速失效。所以,它吧历史经验与使用经验的元指引分开存储,再针对当前任务组合成任务自适应的指导信息。

发生过什么 这类经验该怎么用 ↓ 结合当前任务,编译出这次要用的指引

Live-Evo 的双层记忆
Live-Evo 的双层记忆

Live-Evo 在跨越约 10 周、跟随真实事件和预测市场价格变化的评测中持续运行,并观察到向深度研究任务的迁移。为了估计记忆的实际贡献,每个任务还会额外运行一次无记忆对照。这样可以改善归因质量,但是也显著增加了评测成本。

由静态数据构造的顺序任务适合控制变量,跨越真实时间的评测则更容易暴露反馈延迟、经验过期和环境变化。两类评估回答的问题不同,但是都说明了长期记忆的有效性必须放到时间中检验。

四、时间推移与旧经验失效

时间不仅带来新的任务,也会改变旧经验成立的条件。一条经验可能在写入时完全正确,随着页面改版、接口升级或业务流程调整,却逐渐从帮助变成干扰。

例如,“日期字段统一为 YYYY-MM-DD”曾经适用于一套报表系统;数据源升级为带时区的 ISO 时间后,继续机械执行原有规则就可能破坏有效信息。此时不是记忆写错了,而是环境已经改变。

但旧经验也不能一概删除。它可能不再适用于当前版本,却仍然适用于旧系统、其他业务环境,或者系统回滚后的状态。真正困难的,不只是让 Agent 记住最新规则,而是让它知道什么发生了变化、哪些经验仍然有效,以及每条经验适用于哪个版本。

EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

EvoArena 将这种问题建模为连续演化的版本链,覆盖终端工作流、软件代码库和用户偏好三个领域。论文所评测的 Agent 系统在这些演化环境中的平均准确率为 39.6%,说明在环境持续变化时,现有系统还很难稳定地维护和使用历史经验。

EvoArena 还提出了 EvoMem。它不直接用新记忆覆盖旧记忆,而是将每次变化记录为结构化补丁,保留修改前后的状态、修改原因及相关证据。执行新任务时,Agent 默认使用最新状态;遇到版本冲突、历史状态或回滚问题时,再检索相关的变化记录。

这篇论文真正引入的不是一个简单的时间标签,而是一种版本化的记忆观:记忆不仅要保存当前结论,还要保留结论如何变化,以及它在什么条件下成立。

环境漂移下的记忆补丁
环境漂移下的记忆补丁

EvoMem 相对相应基线取得了提升,但这并未改变现有 Agent 在 EvoArena 上整体表现仍有限。方法有效不是说问题就很好解决了。环境持续变化时,记忆如何安全更新,目前看来没有很成熟的单案。

五、记忆管理策略的自适应

到目前为止,系统调整的主要是记忆内容、经验权重和被召回的内容。再进一步的问题是:何时检索、怎样压缩和何时遗忘的管理策略,能否也根据反馈持续调整?

记忆系统并不是每次都按同一种方式工作。记忆很少时,可能根本不需要检索;遇到重复任务,可以优先复用已经验证过的经验;面对陌生问题,则需要重新生成查询,从记忆库中寻找可能相关的经验。随着记忆不断积累,系统还要决定哪些内容应该保留,哪些需要合并、压缩或清理。

这些选择很难由一套固定规则长期完成。更进一步的记忆系统,不仅要更新记忆内容,还要根据任务和记忆库的状态,调整自己管理和使用记忆的方式。

Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents

将这些记忆操作建模为可学习的控制过程,让系统根据任务反馈进行决策。它可以包裹不同记忆后端,只依赖任务级二元反馈,控制器也不需要额外调用大模型。论文报告的最高成功率提升为 15.2 个点,同时减少了 5% 到 20% 的 token 消耗。

记忆内容可以更新 ↓ 每条经验的效用可以更新 ↓ 检索、压缩和遗忘策略也可以更新

这一层更新的已经不只是数据库记录,而是决定记忆怎样进入推理过程的控制策略。

MemCon 让记忆管理策略随反馈学习
MemCon 让记忆管理策略随反馈学习

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

SWE-MeM 进一步把固定的上下文压缩规则变成了 Agent 可以学习的管理策略。面对不断增长的编码轨迹,Agent 不再等到上下文接近上限时统一压缩,而是根据当前任务进度、历史内容和剩余上下文预算,自主决定什么时候压缩、压缩哪一段,以及应该保留哪些信息。SWE-MeM 将压缩设计成一个可调用的工具,并通过合成轨迹、课程微调和 Memory-aware GRPO,把压缩决策与最终的问题解决效果一起优化。

不过,SWE-MeM 主要处理的是单次长程编码任务中的上下文管理,而且压缩策略是在训练阶段写入模型参数的。部署之后,它不会随着新任务继续更新这套策略。因此,它更接近学会管理记忆,还不是记忆管理策略在运行中持续进化。

MemCon 在模型之外学习控制策略,更便于隔离、替换和版本管理;SWE-MeM 则把更新写入权重,训练成本和回滚方式也随之改变。

系统具备更新能力之后,还需要用后续任务证明这些更新确实有效。能改多深和是否带来稳定收益,是两个不同维度问题。

六、能力阶梯与验证门槛

前面已经提到,判断 Memory 是否发生了进化,要分清两个问题:系统能够对记忆做出哪些调整,以及这些调整能否持续改善后续任务。

1. 记忆能改到哪一层

不同记忆系统能够修改的对象并不相同,可以概括为五个层级。L0 到 L4只表示内容、价值和管理策略的可调整程度,不代表等级的进化。

层级

系统会做什么

这一层能改什么

L0 固定记忆

人工预置的知识和提示

基本不改

L1 追加记忆

自动保存新经验,只增不改

记忆规模

L2 可维护记忆

会合并、限域、更新和遗忘

记忆内容

L3 反馈估值记忆

根据后续结果调整每条经验的效用

每条经验好不好用

L4 自适应管理

检索、压缩、遗忘的规矩本身也在学

管理记忆的策略

Memory 自适应能力五级阶梯
Memory 自适应能力五级阶梯

从人工预置到管理策略可学习,层级描述系统能够修改什么。层级越高,适应空间越大,错误归因和策略漂移的风险也越高;是否真正变好仍需后续任务验证。

从这一视角看,Mem0A-Mem 主要体现 L2 的可维护记忆;MemRLLive-Evo 通过反馈更新经验效用,主要对应 L3;Memento 开始学习案例选择,触及局部 L4;MemCon 则把检索、压缩和遗忘纳入更完整的自适应管理。SWE-MeM 把类似策略写入模型权重,改变的是更新位置,而非层级。

这里的层级高并不自动证明进化成立。一个只会追加经验的系统,如果能够在独立后续任务中持续产生收益,也可能构成最低程度的进化;反过来,具备复杂策略学习能力的系统,如果收益不稳定,仍然只能说明它具有适应能力。

我们在项目中一定要根据实际需求选择方案。在规则稳定、风险敏感的业务中,可审计、可回滚的维护机制比自动学习的管理策略更可靠。适应能力越强,系统能够处理的变化越多,同样错误经验被持续放大的风险也越高。

2. 现有评测在测什么

要用未来任务的表现判断 Memory 是否进化,首先要弄清楚:评测协议实际测量的究竟是什么。

评测集

主要在考什么

能不能回答“以后做得更好”

LoCoMo

单跳、多跳、时序、开放域、对抗拒答

不能,问答是静态的

LongMemEval

抽取、跨会话推理、时间推理、知识更新、拒答

不能,历史是一次性给定的

LongBench

上下文变长之后还能不能答对

不能,它考的是长上下文

LifelongAgentBench

按步骤执行、状态依赖的操作

部分能,但不看跨任务积累

Evo-Memory

顺序任务流里能不能攒经验、再用出去

EvoMemBench

记忆作用在一次任务内还是跨任务,内容偏知识还是偏执行

EvoArena

环境一点点改了之后,旧记忆还对不对

Prophet Arena

跟着真实时间连续跑大约 10 周

能,还会暴露反馈来得晚

LoCoMoLongMemEvalLongBench 等评测主要检验系统能否利用给定历史完成问答或长上下文任务;它们不要求系统在任务之间持续成长。Evo-MemoryEvoMemBenchEvoArena 和 Prophet Arena 则逐步把任务顺序、经验积累、环境变化和真实时间纳入评测。两类基准回答的是不同问题。

3. 怎样证明变化真的有效

第 1 节中我们提过,没有哪种记忆架构能在所有任务上始终领先。所以选择 Memory 框架不能只看单一榜单;要判断它是否真正带来提升,可以进行以下三类对照:

第一,与长上下文基线底座比较。EvoMemBench 将 15 种记忆方法与直接读取完整历史的 Gemini-3-Flash、GPT-5-mini 和 DeepSeek-V3.2 进行比较。结果显示,当历史信息还能放进上下文时,直接交给模型的效果并不差;Memory 的优势主要出现在上下文不足或任务较难时。

第二,与同预算的普通Agent比较。Are Online Skill and Memory Modules Always Worth Their Tokens? 在 Gemini 3 Flash、GPT-5.4-mini 和 Qwen 3.6-27B 上,将 AWM、ASI 和 ReasoningBank 与同 token 预算的普通 Agent 进行比较。结果发现,把 Memory 或 Skill 消耗的 token 用于增加普通 Agent 的推理和探索步骤,整体效果可以追平甚至超过这些增强方法。

第三,报告多次运行的稳定性。论文还对每种设置进行了三次独立运行,发现相同配置在不同运行之间仍存在明显波动。因此,只运行一次或只提升少量百分点,很难说明方法稳定有效,最好分析多次运行的平均值和方差。

七、项目实践中的最小验证

在真实项目中,不建议一开始就给 Agent 接入非常复杂的开源 Memory 框架,建议先判断你的任务能否形成经验闭环。主要看三个条件:任务是否会重复执行,任务的结果和错误有没有评估数据和标准,提炼出的经验有没有后续任务来使用。

Agent 对于成功轨迹可以沉淀可复用的方法,失败轨迹也可以形成约束和反例,关键是系统有没有评估机制,判断哪里做对、哪里做错。比如每周生成业务报告场景:任务持续发生,结果相对容易评价,也能观察本周积累的经验是否改善了下一次执行;而一次性的开放分析任务就很难形成这样的闭环。

场景选定后,可以先记录任务轨迹和反馈,对比不使用 Memory、使用固定 Memory 和允许 Memory 更新三种状态,并保持推理预算一致。初期可以由人工审核经验更新并保留回滚能力;确认收益稳定后,再逐步引入自动更新和策略学习。

结语:记忆的终点不是记得更多

Agent Memory 的研究重点,正在从如何保存更多信息,转向如何让过去真正改善未来。记忆除了需要被正确写入和召回,还需要通过评估结果不断修正,并通过后续任务验证这些变化是否有效。

所以看Memory 是否发生进化,看的是 Agent 能否少走弯路、少犯同样的错误,并在环境变化后及时调整。目前有不少方法在探索这条路径,但能否带来稳定且值得成本的收益,还需更充分的验证。

Memory 中保存的不只有事实和经历,也包括解决问题的方法。当这类程序性内容经过多次任务验证,还可以进一步组织成带有适用条件、输入输出和执行步骤的 Skill。

下一篇将继续讨论 Memory 中更接近行动的一部分:Skill,以及它如何被正确选择、持续验证和更新。

附录:论文数据

下表来自 Are We Ready 的记忆更新对比。同一张表中,知识更新、时间推理和最新状态问答的最佳系统并不相同

系统

LoCoMo 时序 EM / F1

知识更新 EM / F1

时间推理 EM / F1

Long Context(基线)

8.1 / 26.9

20.0 / 18.0

12.0 / 24.0

Embedding RAG(基线)

1.6 / 7.9

20.0 / 17.8

10.7 / 22.7

Mem0(离散事实)

3.2 / 6.0

15.6 / 17.1

10.7 / 22.4

Letta / MemGPT

0.0 / 7.1

17.8 / 5.7

12.0 / 8.8

Zep(时序知识图)

4.8 / 18.1

44.4 / 36.8

13.3 / 30.5

Cognee(实体关系图)

4.0 / 28.1

37.8 / 34.0

18.7 / 35.8

MemoryOS(分段分页)

3.2 / 22.7

35.6 / 32.2

16.0 / 31.6

MemOS(复合+混合检索)

8.9 / 28.0

28.9 / 30.5

12.0 / 31.1

成本侧同样存在显著差异。LightMem 的平均单次操作约为 3.67 秒,对应 48.3 的归一化效用;部分依赖全图整合的系统需要超过一百秒才能把效用推到 84 以上。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、Memory 不是一个装经验的盒子
  • 二、从存放到复用:一条经验的三道关
    • 1. 记忆准入:成功经历也未必值得留下
    • 2. 检索选择:相似不等于有用
    • 3. 复用适配:找到不等于可以照搬
  • 三、从顺序任务到真实在线
  • 四、时间推移与旧经验失效
  • 五、记忆管理策略的自适应
  • 六、能力阶梯与验证门槛
    • 1. 记忆能改到哪一层
    • 2. 现有评测在测什么
    • 3. 怎样证明变化真的有效
  • 七、项目实践中的最小验证
  • 结语:记忆的终点不是记得更多
    • 附录:论文数据
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档