首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Agent持续学习:提示词、模型权重与外部记忆怎么选?

Agent持续学习:提示词、模型权重与外部记忆怎么选?

作者头像
唐国梁Tommy
发布2026-07-21 08:13:01
发布2026-07-21 08:13:01
90
举报

给 Agent 更长的上下文,接上检索,再配一本会自动更新的操作手册,它往往能在下一轮任务中做得更好。我们很容易把这种进步称作“学会了”。

可一旦任务换了、事实被改写,或者操作链拉得更长,这些经验还能留下多少?Agent 究竟是在学习,还是只是在更有效地使用上下文?

论文《When Does Continual Learning Require Learning》研究的正是这件事。作者把四种环境变化和八种更新方法放进同一套实验协议,比较提示词、模型权重和外部记忆各自能解决什么问题。

论文名称: When Does Continual Learning Require Learning 论文链接: https://arxiv.org/abs/2607.07847

持续学习,不只防遗忘

传统持续学习通常从灾难性遗忘出发:模型学任务 B 时,能不能保住任务 A?

部署后的 Agent 遇到的问题更杂。它可能接到一个从未见过的任务;也可能任务没变,但事实、数据分布或应用状态已经不同。此时,过度保护旧知识同样会妨碍适应。

论文先按“空间”和“时间”拆分这些变化。空间变化指领域或任务切换,例如从工具调用转向金融问答,再转向生物知识。时间变化则发生在同一任务内,又包括事实突然改写、弱信号缓慢漂移,以及 Agent 自己的操作不断改变后续环境。

这四种情况需要的更新动作不同:新领域要积累技能;事实变化要精确替换局部知识;长期漂移要从噪声中提取稳定规律;智能体任务则要持续追踪前序操作留下的状态。

用同一套协议比较八种更新方式

横向比较这些方法一直很困难。提示词优化常看少样本泛化,微调看任务准确率,智能体框架看端到端成功率,评价口径并不一致。

论文把学习过程统一为一个阶段序列:模型依次经历 T1TK,每一阶段接收数据,再执行更新算子 Uk。这个算子可以改提示词、改权重、写外部记忆、挂接适配器,也可以不做更新。每类方法在同一基准中使用相同的阶段预算。

每完成一个阶段,模型都要回到所有阶段的评估集上测试。BWT 观察后续学习有没有损害旧任务;FWT 观察已有经验能否帮助尚未训练的新任务。相比当前任务涨了多少分,FWT 更能说明模型是否提取出了可迁移的结构。

参与比较的八种方法分为四组:

  • 提示词更新:GEPAACE,经验被写进系统提示或 Markdown 操作手册;
  • 监督式权重更新:SFTSDFT,后者用上一阶段模型作为自蒸馏教师;
  • 在线强化学习:GRPOSDPO,通过奖励或偏好对更新参数;
  • 上下文压缩:CartridgesIn-place TTT,用稀疏组件或输入级更新保存信息。

方法之间最根本的差别,可以归结为一个问题:新经验最终被写进上下文、模型参数,还是外部状态?

四组实验,没有统一赢家

新领域:当前学得快,不代表能力留得住

第一组实验让 Qwen3-8B 依次学习 ToolUseFinQASciKE-Bio,每阶段使用 500 个样本。

GEPA 在当前任务上拟合很快。金融阶段的性能一度提升接近 40 个百分点,但进入生物阶段后,金融能力几乎跌回训练前水平。ACE 稍稳定一些,整体走势仍然相似。

SDFT 的表现不同。顺序训练结束时,它是唯一一个在三个任务上都不低于各自零样本基线的方法。这个结果很具体:提示词可以迅速改善当前任务,却未必能把新能力稳定地留下来。

事实改写:模型也会把旧知识“记死”

第二组实验使用 2025 年 11 月到 2026 年 2 月的四份 Wikipedia 月度快照。研究者从相邻版本中抽取发生变化的事实,同时保留一组始终未变的事实,用来检查更新是否误伤旧知识。

在跨领域实验中表现稳定的 SDFTSDPO,到了这里反而很难处理事实改写。SDFT 的稳定事实 F1 从约 0.30 降到约 0.15。论文把这类失败称为灾难性记忆:模型试图维持旧分布,却没有干净地接受新事实,还连带破坏了本不该变化的知识。

GRPO 更适合这类更新。它在整个链条上平均高于基线 1.6 个百分点,单个阶段最高提升 6.2 个百分点。GEPA 能迅速把新事实写进操作手册,但会牺牲稳定知识;两种上下文压缩方法对底座模型的事实能力影响很小。

缓慢漂移:奖励越嘈杂,快速更新越危险

第三组实验换成了金融年报。模型按年份阅读 2015 至 2020 年的 10-K 文件,预测披露后 30 天的股票涨跌。单份年报通常有 1 万至 1.3 万个 token,而涨跌标签本身就很嘈杂。

到了这项任务,GRPO 不再占优。论文给出的解释是:组内奖励排序一旦不可靠,强化学习可能反复强化错误答案。提示词方法也会归纳出“关注增长、风险和现金流”一类通用规则,却很难找到真正跨年份有效的信号。

SDFT 的未来年份准确率到 2020 年升至约 0.62,过去年份维持在约 0.50;Cartridges 的前后年份表现大致稳定在 0.55 到 0.58。对缓慢趋势而言,能否过滤噪声、保留跨期结构,比短期内追着奖励变化更重要。

智能体状态:学习抬高了曲线,长链问题仍在

最后一组实验来自浏览器 Agent。以 Gmail 为例,模型先创建标签,再重命名,最后把新名字的标签应用到指定邮件。后一步能否成功,取决于前一步在真实应用中留下的状态。

Qwen-32B 配合 ACE 操作手册后,三步链成功率从 32.4% 提升到 46.5%。Qwen-8B 在零样本设置下一步之后几乎归零;经过教师轨迹监督微调,三步、五步和十步链仍分别达到 40.0%、20.0% 和 6.7%。

两种学习方式都让成功率高于各自基线,但曲线随链长下降的形状没有改变。经验确实有用,它还不足以解决长距离状态追踪。

先判断变了什么,再决定更新哪里

这些实验不适合排成一张总榜。每种方法的优点,都依赖于环境以什么方式变化。

提示词更新适合快速吸收当前经验,却容易过拟合;蒸馏有利于稳定积累,但可能妨碍事实改写;上下文压缩擅长信息管理,并不会自动带来新能力;在线强化学习能处理明确的知识更新,却要求奖励足够可靠。

对 Agent 持续学习来说,更新写在哪里,与采用什么算法同样重要。

从系统设计角度看,单一机制很难覆盖所有情况。新技能通常需要进入模型权重;局部事实需要可控、可回退的更新;慢趋势需要跨阶段积累;短期任务状态更适合放在外部记忆中。这是根据论文结果得到的工程推论,并不是论文已经验证过的一套完整架构。

这些结论还不能推多远

论文的主要比较都基于 Qwen3-8B 非思考模型。模型规模、推理模式和训练预算发生变化后,方法之间的相对表现也可能改变。四组任务覆盖了领域切换、事实更新、时间漂移和智能体状态,但离开放世界中的长期反馈、知识冲突和不确定性还有距离。

智能体实验还使用了不同规模的模型和不同更新机制。它可以说明学习带来了增益,却不能用来直接判断 ACESFT 谁更好。

这篇论文没有给出 Agent 持续学习的最终配方。它先做了一件更基础的事:把几类经常混在一起的问题分开。

长期运行的 Agent 需要的不只是更多记忆。它还要判断,这次变化应该写进上下文、外部状态,还是模型权重。位置判断错了,记得再多也未必等于学会了。


进阶学习

如果你正在关注大模型 Agent、强化学习后训练、RLHF、DPO、GRPO、RLVR 等前沿方向,欢迎学习我最新上线的精品课程:

课程围绕 Agent 架构、强化学习基础、Reward 设计、策略优化、工具调用、多轮任务执行、Agentic Workflow 以及前沿论文与实战案例展开,帮助你建立从理论到应用的完整知识体系。

Agent RL 正在成为大模型能力提升与智能体系统演进中的重要方向。未来的 Agent 不只是会调用工具,而是要能规划任务、评估结果、修正策略,并在复杂环境中持续优化自己的行为。

现在系统学习 Agent RL,提前进入下一阶段 AI 应用开发的核心赛道。


🌟 关注“唐国梁TGLTommy”,一起持续追踪 AI 技术演进背后的长期趋势。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-18,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 唐国梁TGLTommy 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 持续学习,不只防遗忘
  • 用同一套协议比较八种更新方式
  • 四组实验,没有统一赢家
    • 新领域:当前学得快,不代表能力留得住
    • 事实改写:模型也会把旧知识“记死”
    • 缓慢漂移:奖励越嘈杂,快速更新越危险
    • 智能体状态:学习抬高了曲线,长链问题仍在
  • 先判断变了什么,再决定更新哪里
  • 这些结论还不能推多远
  • 进阶学习
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档