背景:GPT-6系列首个模型发布,目前仅合作伙伴可用,价格 10/50 美元、Sol 的 2.5 倍、与 Fable 5.1 持平;参数量和Token成本大幅提升,超过 10 万块 GPU 训练,由前代模型监督训练。
1️⃣ 变化 一次跑完、中途插话:按 AA 每任务账单反推,Astra 通用任务输出Token下降约10%、编码Agent下降约70%;API 新增中途纠偏不丢进度、异步工具调用、中途改 effort。新方法解决旧问题、长程任务更短更稳、通用综合分没动。
2️⃣ 分数 不是通用能力的跃升:知识工作 GDPval 比 Sol 掉 80 Elo,HLE +6;FrontierMath T4 97.6%、GPQA 96% 为官方自报。#规模买到的是效率与时长、不是分数、基础能力代际趋同、增量转向专业长程任务,延续我们 8/13 的判断。
3️⃣ 价格 效率没让给客户:OpenAI 涨价 2.5 倍,AA 综合分 61,对 Sol 零增长、比 Fable 5.1 的 66 低 5 分;缓存命中仍按 10% 计,超 27.2 万 token 再加价;AA 通用任务每任务 1.67 美元、比 Sol 贵 76%,倒算下来省下的Token抵不过2.5倍单价,Anthropic把效率变成降价、OpenAI把效率变成涨价、虽然更省token、但单任务变得更贵了。
关键变化:Astra 的变化主要发生在任务完成方式上。
官方口径是最大规模预训练叠加长程 RL、由前代模型监督训练;我们认为,效果上相当于在模型内部以Multi-Agent的形式运行长程任务,大幅提升了 one shot 任务的表现,并可以中途添加引导而不打断任务。#这似乎是在用新方法解决旧问题、没有实现模型能力大幅提升后对应新场景的解锁,但完成率跨过了临界点、经济性在 Agent 编码类长程场景跨过了临界点,有望提高现有场景的渗透增速。