Kimi K3 这次把 AgentEnv 也一起开源了,智能体沙箱支持快照、恢复和分叉;训练侧的 partial rollout 更直接——长尾轨迹跑不完就先暂停入队,下一轮优先恢复,而不是直接判它失败。英伟达今天发布的 Nemotron 3 也把上下文漂移和推理成本列为多智能体系统的主要瓶颈。我的感觉是,长程 Agent 的工程重心正从“怎么让它一次跑对”变成“怎么让它中断后接得上”。想问下大家在生产环境里,检查点是做在沙箱层做整机快照,还是做在编排层只存任务状态和工具调用记录?两种做法在恢复成功率和存储成本上的实际差别有多大?
相似问题