【产品发布】
北京时间9月4日,OpenAI发布GPT-6 Astra,定位复杂推理、编程、计算机操作、科学研究和专业知识工作的旗舰模型。GPT-6 Astra支持105万Token上下文和12.8万Token最大输出,可处理文本及图片输入,并提供low至max五档推理强度。产品层面,GPT-6 Astra新增异步工具调用、任务执行过程中的指令调整,以及在保留缓存的同时动态改变推理强度;Codex还将试验跨上下文窗口保存笔记和检索历史内容,进一步提升长周期Agent任务的连续性。目前GPT-6 Astra首先向少量机构开放,未来数日将逐步覆盖ChatGPT Plus、Pro、Business和Enterprise用户,并通过OpenAI API及Amazon Bedrock提供服务,Pro、Business和Enterprise用户还将获得Astra Pro访问权限。
【模型亮点】
我们认为,GPT-6 Astra最重要的变化是模型开始将推理、软件操作和安全判断整合为完整的端到端执行能力,测试中复杂任务完成率提升显著。计算机操作方面,Astra在OSWorld 2.0上得分72.6%,高于GPT-5.6 Sol的65.7%,单项任务耗时降低约47%;在专业流程测试AutomationBench上得分41.4%,较GPT-5.6 Sol的18.1%提升明显。编程方面,Astra在Terminal-Bench 4.0上得分57.9%,高于GPT-5.6 Sol的37.3%和Claude Fable 5.1的55.8%。科学推理方面,GPT-6 Astra在FrontierMath Tier 4上取得97.6%,并协助研究人员改进两项长期未突破的素数间隔问题。网络安全是本次提升最显著、同时风险最高的领域:Astra在ExploitBench上达到100%,在使用2026年6月至8月新漏洞构建的低污染测试集上得分39.0%,较GPT-5.6 Sol的11.5%明显提升。
【模型痛点】
我们认为,GPT-6 Astra仍有三点核心痛点:1)单位Token定价显著提升。Astra标准API价格为输入10美元、缓存输入1美元、缓存写入12.5美元、输出50美元/百万Token,输入和输出价格均为GPT-5.6 Sol的2.5倍;当输入超过27.2万Token时,整次请求的输入和缓存费率翻倍、输出费率提升50%;2)GPT-6 Astra产品首发仅覆盖少量机构,缺乏大规模生产环境验证,OpenAI公布的多数成绩取自研究环境或内部测试,实际ChatGPT和企业工作流表现可能存在差异;3)高网络安全能力带来更严格的使用限制。GPT-6 Astra默认拒绝高级漏洞利用任务,监控系统可能暂停或终止正常的防御性工作;OpenAI同时承认,Astra书面推理过程的可监控性弱于GPT-5.6 Sol。