首页
学习
活动
专区
圈层
工具
发布

【GPT-6】Astra引入Loop Transformer,新一轮Latent Scaling开启

1)能力从Coding向严肃知识工作全面扩散。GPT-6 Astra在计算机操作、浏览器、软件工程、科学研究及专业工作等领域均实现领先,并能跨代码、浏览器和专业软件完成复杂多步骤工作流。相较此前主要由Coding拉动的能力跃迁,Astra在研究、办公和计算机操作等维度进步更加均衡,旗舰模型正加速从Coding Agent走向通用生产力Agent。

2)Loop Transformer打开新一轮Latent Scaling。Astra或通过同一套Transformer权重进行重复计算:例如22层循环两次仍只计22层独立参数,却形成44层有效计算深度,使更多推理在隐藏状态中完成,并以更短的外显CoT完成更复杂任务。由此,#模型Scaling在参数量之外新增“循环深度”这一维度,同等参数量下,#模型有效深度和每Token推理计算量可随循环次数近线性增长。

3)以更多算力换取更高的单位参数能力,进一步强化推理计算需求。#Loop Transformer本质上是用Tensor Core算力、HBM带宽和推理延迟,换取更低的权重存储容量与更强的单位参数能力:固定循环两次时,参数量及权重显存基本不变,但单Token计算量、权重读取及模型并行通信均接近翻倍,非共享KV Cache也可能同步增加。其最明确的产业影响是计算量持续提升,#模型Scaling正由参数驱动转向“参数量+每Token计算深度”共同驱动。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OQzYdA2bn4HrgxYrzLEgwleA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券