首页
学习
活动
专区
圈层
工具
发布

我们做了个开源、不限模型的智能体框架,跟 Claude 托管智能体对比:同模型准确率一样,成本最高省 75%

我们一直在做一个叫 TrueForge 的开源、不限模型的通用智能体框架,就想搞清楚框架本身到底有多大影响。

于是我们用 DevRev 的 Enterprise-Bench 跑了 14 个任务,好几种框架和模型组合都试了,每个组合跑三遍,还找了盲评裁判。

最让我意外的结果是:Claude 托管智能体配 Opus 4.8,解了 11/14 个任务,每次约 11.8 美元、用 1000 万 token;TrueForge 配同一个 Opus 4.8,也是 11/14,但每次只要 8.6 美元、370 万 token。

模型一样,基准一样,解题率也差不多。但 TrueForge 少了约 63% 的 token,单次成本便宜了约 30%。工具调用也更少:平均每个任务 19 次,Claude 那边是 32 次。

差别主要来自 agent 循环本身——轮次之间带的上下文更少、做了压缩、工具调用更少,大段输出尽量不进模型上下文。

后来我们换了模型试。TrueForge 配 GLM-5.2,解了 11.7/14,每次 3 美元、380 万 token。在这个基准上,比 Claude 托管智能体配 Opus 略高一点,成本却大概低了 75%。

我觉得这才是不限模型框架更有意思的地方:你有两个独立抓手,一是让运行更省 token,二是按工作负载自由选性价比合适的模型。

TrueForge 本身挺简单,管 agent 循环、上下文、工具/MCP、子智能体、审批、持久会话和沙箱集成。MIT 协议,兼容 OpenAI 接口,托管或自跑的模型都能接。

不过现在还早。开源版还没有一流的追踪/评估工具,也不自带代码沙箱,得自己接一个,上下文压缩是有损的。所以我现在不敢说它能逐个功能替代成熟的托管平台。

但核心运行在这些任务上已经能打,还保持开源、不限模型、能部署在你自己环境里,这点我挺感兴趣的。

基准测试和方法的细节我们都放仓库里了,方便大家复现、换模型,或者来指出哪里比得不公平。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OZdClMIu7XKN8YEzI2cgwcMQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券