推荐系统靠用户行为迭代,这事不新鲜。点击、跳过、搜索、删除,每条交互都是带标注的样本信号。
Agent 也可以这么迭代。信号从点击换成修正。
CopilotKit 团队分享了他们是怎么做的。
看这个视频,用户如何捕获一个工作流,让Agent学习和修复。
用户每次修正Agent的错误,就是一条带标签的样本。没有基准测试能给你这个。真实用户在实际场景里告诉你"不对,应该这样做"。比一百次合成测试值钱。
问题是,大多数产品让这些"反馈"白白消失。
两个信号源
一是Agent轨迹:Agent运行时的每一步,它被问了什么、调用了哪些工具、返回了什么、在哪失败了。用另一个Agent分析这些轨迹,找到失败模式,重写提示词、工具和指令。
二是浏览器内的用户活动:用户的点击、编辑、批准、修正。Brex就在这么做,观察分析师的工作,把每次人工修正作为训练信号反馈回去。
大多数方案只用了其中一种。只追踪Agent,看不到用户为什么修正;只观察用户,不知道Agent为什么失败。

两种信号同时捕获才有意义。在哪?在用户和Agent协同工作的界面,那个表面同时看到两者。
CopilotKit通过AG-UI(Agent-User Interaction Protocol) 做到这一点。一个开放标准,实时流式传输应用、用户和Agent之间的每一个事件。已被AWS、Google、Microsoft、Oracle、LangChain、Mastra、Pydantic AI、CrewAI、LlamaIndex等采用。

学习落在三个层面

三种学习类型

语义保持真实,情景保持案例,程序保持规则。

数据所有权才是护城河
就如同昨天更新微软CEO新长文《微软CEO Satya Nadella新长文:反向信息悖论,新的“便利论”?》所讲,企业数据越来越成为核心壁垒,不论自己用还是送别人,如何炼化它们转化为价值是其中绕不开的关键问题。
学习数据是产品最重要的部分。从头构建软件的成本在降,数据的价值在涨。
CopilotKit Intelligence自我托管在你的Kubernetes集群上。数据主权完整,SOC 2 Type II,支持气隙部署。数据留在你手里,Agent学到的一切也留在你手里。
其他人的方案要么把学习数据留在他们的云里,要么靠监视来获取。

学习容器决定"谁"获得新知识。按用户、按团队、按应用定义范围,完全可审计。

总结一张图:

CopilotKit Intelligence这套架构是当前智能体产品缺失的板块,曾经吴恩达在AI 1.0提到过从模型为中心向数据为中心构建AI应用的观点,现在这套思路也可以搬到AI2.0上面,值得一提的是,它已经在大型企业生产环境中运行。想让Agent越用越聪明,值得看看。