首页
学习
活动
专区
圈层
工具
发布

【GPT-6 Astra】发布:模型能力迈进AGI范畴,复杂任务打开推理需求

OpenAI发布新一代旗舰模型GPT-6 Astra,模型逐步开始迈进AGI范畴。AGI测评分数达99%:ARC-AGI-3不向模型说明任务目标和环境规则,只提供当前画面与可执行操作,要求模型通过交互试错自行推断机制并完成任务。Astra在配合Harness后达到99.9%,人类平均得分48%,GPT-6 在陌生环境学习和迁移能力已超过多数人类。

Astra在科研、数学等高价值场景中能力进一步突破。Astra在高难数学评测FrontierMath Tier 4得分由Sol的83.0%提升至97.6%,科学任务评测由22.4%提升至64.6%。Astra协助将短素数间隔上界从240推进至186,改进了一个80多年未有新发现的数学问题,模型开始真正进入新知识的发现和验证环节。除抽象推理外,Astra在判断力、专业工作和科学研究方面中的悟性均有大幅提升。面对不完整指令,模型可以自行补齐常规信息,只在影响结果的关键决策上询问用户,并同步推进其他工作;制作文档、表格和PPT时能够遵循已有模板、版式与写作风格。

电脑操控能力再一次大幅突破,强过多数人类用户。官方演示中,Astra可根据电路原理图完成元件摆放和PCB布线设计,也能依据静帧在Blender建模,再导入UE5生成可预览场景。Astra在OSWorld 2.0得分72.6%,单项任务时间由75分钟降至40分钟,ScreenSpot-Pro达到92.7%。模型在电脑操控能力大幅提升,使模型能够嵌入到更多工程设计和软件排障等高价值真实工作流中。

价格方面,Astra标准API每百万Token输入10美元、输出50美元,均为GPT-5.6 Sol的2.5倍。模型能够处理的任务更复杂、执行时间更长,叠加价格显著提高,单任务推理价值量进一步放大。随着后续付费用户、API陆续开放,Agent使用量与单任务推理支出有望同步增长,继续看好Token调用及算力需求。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OERyjEHhcRknERVo0OHBkUuw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券