
给 Agent 更长的上下文,接上检索,再配一本会自动更新的操作手册,它往往能在下一轮任务中做得更好。我们很容易把这种进步称作“学会了”。
可一旦任务换了、事实被改写,或者操作链拉得更长,这些经验还能留下多少?Agent 究竟是在学习,还是只是在更有效地使用上下文?

论文《When Does Continual Learning Require Learning》研究的正是这件事。作者把四种环境变化和八种更新方法放进同一套实验协议,比较提示词、模型权重和外部记忆各自能解决什么问题。
论文名称: When Does Continual Learning Require Learning 论文链接: https://arxiv.org/abs/2607.07847

传统持续学习通常从灾难性遗忘出发:模型学任务 B 时,能不能保住任务 A?
部署后的 Agent 遇到的问题更杂。它可能接到一个从未见过的任务;也可能任务没变,但事实、数据分布或应用状态已经不同。此时,过度保护旧知识同样会妨碍适应。
论文先按“空间”和“时间”拆分这些变化。空间变化指领域或任务切换,例如从工具调用转向金融问答,再转向生物知识。时间变化则发生在同一任务内,又包括事实突然改写、弱信号缓慢漂移,以及 Agent 自己的操作不断改变后续环境。
这四种情况需要的更新动作不同:新领域要积累技能;事实变化要精确替换局部知识;长期漂移要从噪声中提取稳定规律;智能体任务则要持续追踪前序操作留下的状态。

横向比较这些方法一直很困难。提示词优化常看少样本泛化,微调看任务准确率,智能体框架看端到端成功率,评价口径并不一致。
论文把学习过程统一为一个阶段序列:模型依次经历 T1 到 TK,每一阶段接收数据,再执行更新算子 Uk。这个算子可以改提示词、改权重、写外部记忆、挂接适配器,也可以不做更新。每类方法在同一基准中使用相同的阶段预算。

每完成一个阶段,模型都要回到所有阶段的评估集上测试。BWT 观察后续学习有没有损害旧任务;FWT 观察已有经验能否帮助尚未训练的新任务。相比当前任务涨了多少分,FWT 更能说明模型是否提取出了可迁移的结构。

参与比较的八种方法分为四组:
GEPA、ACE,经验被写进系统提示或 Markdown 操作手册;SFT、SDFT,后者用上一阶段模型作为自蒸馏教师;GRPO、SDPO,通过奖励或偏好对更新参数;Cartridges、In-place TTT,用稀疏组件或输入级更新保存信息。方法之间最根本的差别,可以归结为一个问题:新经验最终被写进上下文、模型参数,还是外部状态?
第一组实验让 Qwen3-8B 依次学习 ToolUse、FinQA 和 SciKE-Bio,每阶段使用 500 个样本。
GEPA 在当前任务上拟合很快。金融阶段的性能一度提升接近 40 个百分点,但进入生物阶段后,金融能力几乎跌回训练前水平。ACE 稍稳定一些,整体走势仍然相似。
SDFT 的表现不同。顺序训练结束时,它是唯一一个在三个任务上都不低于各自零样本基线的方法。这个结果很具体:提示词可以迅速改善当前任务,却未必能把新能力稳定地留下来。

第二组实验使用 2025 年 11 月到 2026 年 2 月的四份 Wikipedia 月度快照。研究者从相邻版本中抽取发生变化的事实,同时保留一组始终未变的事实,用来检查更新是否误伤旧知识。

在跨领域实验中表现稳定的 SDFT 和 SDPO,到了这里反而很难处理事实改写。SDFT 的稳定事实 F1 从约 0.30 降到约 0.15。论文把这类失败称为灾难性记忆:模型试图维持旧分布,却没有干净地接受新事实,还连带破坏了本不该变化的知识。
GRPO 更适合这类更新。它在整个链条上平均高于基线 1.6 个百分点,单个阶段最高提升 6.2 个百分点。GEPA 能迅速把新事实写进操作手册,但会牺牲稳定知识;两种上下文压缩方法对底座模型的事实能力影响很小。

第三组实验换成了金融年报。模型按年份阅读 2015 至 2020 年的 10-K 文件,预测披露后 30 天的股票涨跌。单份年报通常有 1 万至 1.3 万个 token,而涨跌标签本身就很嘈杂。

到了这项任务,GRPO 不再占优。论文给出的解释是:组内奖励排序一旦不可靠,强化学习可能反复强化错误答案。提示词方法也会归纳出“关注增长、风险和现金流”一类通用规则,却很难找到真正跨年份有效的信号。
SDFT 的未来年份准确率到 2020 年升至约 0.62,过去年份维持在约 0.50;Cartridges 的前后年份表现大致稳定在 0.55 到 0.58。对缓慢趋势而言,能否过滤噪声、保留跨期结构,比短期内追着奖励变化更重要。

最后一组实验来自浏览器 Agent。以 Gmail 为例,模型先创建标签,再重命名,最后把新名字的标签应用到指定邮件。后一步能否成功,取决于前一步在真实应用中留下的状态。

Qwen-32B 配合 ACE 操作手册后,三步链成功率从 32.4% 提升到 46.5%。Qwen-8B 在零样本设置下一步之后几乎归零;经过教师轨迹监督微调,三步、五步和十步链仍分别达到 40.0%、20.0% 和 6.7%。
两种学习方式都让成功率高于各自基线,但曲线随链长下降的形状没有改变。经验确实有用,它还不足以解决长距离状态追踪。

这些实验不适合排成一张总榜。每种方法的优点,都依赖于环境以什么方式变化。
提示词更新适合快速吸收当前经验,却容易过拟合;蒸馏有利于稳定积累,但可能妨碍事实改写;上下文压缩擅长信息管理,并不会自动带来新能力;在线强化学习能处理明确的知识更新,却要求奖励足够可靠。

对 Agent 持续学习来说,更新写在哪里,与采用什么算法同样重要。
从系统设计角度看,单一机制很难覆盖所有情况。新技能通常需要进入模型权重;局部事实需要可控、可回退的更新;慢趋势需要跨阶段积累;短期任务状态更适合放在外部记忆中。这是根据论文结果得到的工程推论,并不是论文已经验证过的一套完整架构。
论文的主要比较都基于 Qwen3-8B 非思考模型。模型规模、推理模式和训练预算发生变化后,方法之间的相对表现也可能改变。四组任务覆盖了领域切换、事实更新、时间漂移和智能体状态,但离开放世界中的长期反馈、知识冲突和不确定性还有距离。
智能体实验还使用了不同规模的模型和不同更新机制。它可以说明学习带来了增益,却不能用来直接判断 ACE 和 SFT 谁更好。
这篇论文没有给出 Agent 持续学习的最终配方。它先做了一件更基础的事:把几类经常混在一起的问题分开。
长期运行的 Agent 需要的不只是更多记忆。它还要判断,这次变化应该写进上下文、外部状态,还是模型权重。位置判断错了,记得再多也未必等于学会了。
如果你正在关注大模型 Agent、强化学习后训练、RLHF、DPO、GRPO、RLVR 等前沿方向,欢迎学习我最新上线的精品课程:
课程围绕 Agent 架构、强化学习基础、Reward 设计、策略优化、工具调用、多轮任务执行、Agentic Workflow 以及前沿论文与实战案例展开,帮助你建立从理论到应用的完整知识体系。
Agent RL 正在成为大模型能力提升与智能体系统演进中的重要方向。未来的 Agent 不只是会调用工具,而是要能规划任务、评估结果、修正策略,并在复杂环境中持续优化自己的行为。
现在系统学习 Agent RL,提前进入下一阶段 AI 应用开发的核心赛道。
🌟 关注“唐国梁TGLTommy”,一起持续追踪 AI 技术演进背后的长期趋势。