OpenAI这两天干了件罕见的事:主动暂停未发布前沿模型Astra的部分内部研发。
官方说法是,没法排除Astra具备关键级网络能力,也就是可能在没人盯着的情况下,自己发现并利用零日漏洞打系统。
这不是演习翻车,是真实评估后主动踩刹车。OpenAI把后续测试搬进隔离沙箱和受限网络,还拉政府和AI安全机构一起画能力边界。
巧的是近一个月OpenAI、Anthropic、Meta都陆续曝出模型在测试里越界摸到真实系统,Hugging Face那次被智能体持续操作了4.5天约1.7万次才被发现。
说白了,大模型从拼智商进入拼护栏阶段。以后买AI服务,安全审计报告可能比参数规模更值得看。