首页
学习
活动
专区
圈层
工具
发布

OpenAI发布GPT-5.6开发者指南详解智能体降本

IT时代网8月17日消息,OpenAI在8月13日上线了一份面向开发者的GPT‑5.6使用指南,把过去几个月里初创团队在生产环境中积累的经验做了系统梳理。文档给出的核心判断是,搭建智能体的成本结构已经变了:不少过去必须全程依赖旗舰模型的场景,如今换用小尺寸模型、调低推理强度并改造调用架构,就能拿到相当甚至更好的结果。

GPT‑5.6家族包含Sol、Terra、Luna三款模型。按官方给出的测试,在Agents’ Last Exam这项智能体评估中,保持外围框架不变,Sol以“低”推理强度跑出的成绩超过了GPT‑5.5的“高”推理强度。检索类评估BrowseComp的对比更直观:三个月前GPT‑5.5在最高推理档拿到84.36%,花费33.27美元;GPT‑5.6 Luna在同一档位得到84.04%,成本只要1.33美元,此后官方又下调了价格。

指南举了一个法律科技公司的流程例子,手写备忘录的抽取环节交给Terra或Luna,只在需要判断的分析步骤调用更强的模型,整体开销明显下降。按文档说法,小尺寸模型适合高并发、对延迟敏感,以及智能体流程里反复执行的那些步骤。

与模型一同更新的是Responses API的几项能力。推理过程可以跨模型轮次保留,配合原生压缩机制压缩长对话,智能体在长周期任务中不必反复重建上文;原生多智能体编排允许主智能体拆分任务、多个子智能体并行推进,再把结果交回主智能体汇总,ChatGPT里的ultra档位用的就是这套机制;程序化工具调用则让模型直接写JavaScript来编排工具,把过滤、聚合这类确定性工作挪到上下文窗口之外执行,模型只保留需要判断的部分。

这几项组合起来的效果被写进了ARC‑AGI‑3的测试记录。标准框架下Sol得分13.3%,开启保留推理与压缩之后跳到38.3%,输出token反而少了约6倍。模型本身没换,成绩接近原来的三倍。

参与早期测试的团队给出了各自的数字。Hypha称Luna保住了GPT‑5.5约98%的文档抽取准确率,成本只有后者的十八分之一;Browser Use用Luna跑106项最难的浏览器任务,完成78%花掉约14美元,而当前最强模型完成80%需要约235美元;PlayerZero在多智能体工程系统的一项代码检索任务上,把推理成本压低64%、响应时间缩短90%,F1提升5个点。做金融研究的Rogo则表示,改用程序化工具调用后输入token减少21%,评分标准下的质量没有下滑。

提示缓存这块也做了调整。整个GPT‑5.6家族的缓存有效期最短延长到30分钟,缓存断点可以在上下文窗口内按确定位置设置。一家名为Ploy的公司给29000token的提示加上缓存断点和工作区级别的键之后,未命中缓存的输入减少了28%,智能体在多次运行之间能复用同一段上下文。

这份指南由四位长期跟进初创团队落地情况的OpenAI员工整理,归入官方Applied AI栏目。

注:本文综合自OpenAI等,文中包含AI辅助创作的内容。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OKpyh7rAVEHZOJIkgIYdjbEw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券