首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI Agent 正进入“单位任务成本”时代:从 Gemini 3.6 Flash 到 Agent Harness

AI Agent 正进入“单位任务成本”时代:从 Gemini 3.6 Flash 到 Agent Harness

原创
作者头像
用户9746675
发布2026-07-23 12:42:47
发布2026-07-23 12:42:47
1340
举报

过去一年,AI Agent 的讨论重点一直是“模型能不能做成事”;到了 2026 年下半年,问题正在变成“它能否以可控成本、稳定地把事做完”。最近一周的两项技术更新,清晰地反映了这个变化。

一、Gemini 3.6 Flash:优化的不只是模型分数

7 月 21 日,Google 发布 Gemini 3.6 Flash。官方数据显示,相比 3.5 Flash,新模型在 Artificial Analysis Index 上减少了 17% 的输出 Token,完成多步骤工作流时需要的推理步骤和工具调用也更少。更值得注意的是,Google 把“每个 Agent 任务的总体成本”作为核心卖点,而不只是强调基准测试分数。

Agent 不同于普通聊天机器人。一次任务往往包含规划、检索、调用 API、执行代码和失败重试。即使单次 Token 价格很低,如果模型反复走错路径,最终账单与响应时间仍会失控。因此,更有意义的指标应从“每百万 Token 多少钱”转向“成功完成一个任务要花多少钱”。

二、Agent Harness 正成为新的基础设施层

与模型侧降本同步,Microsoft 最近发布了 Agent Framework Harness。它把工具调用、历史持久化、任务规划、上下文压缩、人工审批和遥测等能力封装成可复用运行时,支持 Python 与 .NET。开发者不必为每个 Agent 重写循环与状态管理,只需提供模型、指令和业务工具。

这说明 Agent 的竞争正在从模型能力扩展到系统工程。模型像发动机,Harness 更像底盘和仪表盘:前者决定能力上限,后者决定系统能否长期运行、故障能否定位,以及敏感操作是否可控。企业最终依赖的,可能不是某个固定模型,而是一套可以切换模型、管理权限并持续观测的运行环境。

三、云上 Agent 应该怎样设计

对准备落地 Agent 的团队,我建议先做四件事:第一,记录完整任务轨迹,把模型调用、工具耗时、重试次数和人工介入都纳入监控;第二,设置单任务预算和最大步骤数,避免错误循环持续消耗资源;第三,根据难度进行模型路由,简单提取交给低成本模型,复杂规划再升级到强模型;第四,把高风险工具放进审批与沙箱,明确哪些操作可自动执行,哪些必须由人确认。

云平台可以为这些设计提供稳定底座。函数计算承载短时工具任务,消息队列拆分长流程,对象存储保存中间产物,日志与监控服务追踪调用链。将它们与 Agent Harness 组合,通常比单纯更换大模型更容易获得稳定收益。

结语

Gemini 3.6 Flash 和 Agent Harness 指向了同一个趋势:AI Agent 正从“演示能力”走向“生产效率”。下一阶段的胜负手,不只是模型回答得有多聪明,而是系统能否用更少步骤、更低成本和更清晰的权限边界,持续完成真实任务。对开发者而言,现在最值得优化的指标,或许已经不是 Token 单价,而是每个成功任务的综合成本。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档