现实版《终结者》上演?OpenAI测试AI攻击力,结果AI真的出手了。
7月29日,之前入侵AI开源平台Hugging Face(业内俗称“抱抱脸”)的那个OpenAI失控AI智能体,又攻破了第二家科技公司的客户系统。
这家倒霉的公司叫Modal Labs,是一家面向开发者的云计算平台。
它的首席技术官Akshat Bubna出来解释说:被入侵的是他们一个客户的“沙箱”环境(也就是隔离测试区)。
这个客户自己开了一个对外公开的接口,任何人都能用它来运行代码。然后,那个失控的AI智能体就顺着这个接口钻了进去。
不过Modal强调了一点:我们平台本身没被黑,是客户的锅。
OpenAI对这事儿拒绝评论。
AI是怎么“越狱”的?
7月16日,Hugging Face率先披露自己遭了入侵,还是被一个AI入侵了。
这是全球首次公开披露的、由AI系统在脱离人类控制的情况下自主实施的网络攻击。
起因是OpenAI在做一次内部测试。
测试用的工具叫ExploitGym,可以把它理解成一场“黑客考试”——专门测试AI模型能不能把已知的安全漏洞串联成一套真实的攻击。
为了测出AI的能力上限,OpenAI的研究团队刻意降低了安全防护等级,关掉了一些阻止模型搞黑客行为的过滤器。
(简单理解就是,OpenAI想测测自家AI多能“打”,故意关了安全锁)
结果,“不负众望”,AI不仅通过了考试,还自己给自己加了题——它发现测试环境有个漏洞,成功“越狱”逃了出去。
逃出来后,它自己推断:Hugging Face平台上可能存着ExploitGym的测试答案和数据集;于是,它利用偷来的登录凭证和更多漏洞,直接攻入了Hugging Face的生产数据库,把答案偷了出来。
整条攻击链——从发现漏洞、逃出沙箱、跨系统横移、到窃取数据——全程由AI自主完成,没有人类干预,产生了超过1.7万条操作记录。
更离谱的是,这个AI从7月9日左右就开始尝试突破,7月11日成功入侵Hugging Face,连续作案三天,OpenAI的后台监测系统愣是没发现。
直到7月16日Hugging Face自己发现并处置了入侵,又过了5天才确认是OpenAI的模型干的。
7月21日,OpenAI才公开承认,表示这些模型“为实现一个相当狭窄的测试目标而采取了极端手段”。
(就是说,AI不仅完成了测试,还自己越狱跑出去“实战”了,黑了Hugging Face偷答案)
为什么要入侵Hugging Face?
为了偷考试答案。
AI发现Hugging Face平台上可能存有ExploitGym测试相关的资料,于是自己决定——去偷。
然后,黑完一家还不够,又顺带入侵了刚开始说的那家Modal Labs发一个客户的系统。
>>炸了!这能叫“失控”?
事件曝光后,网络安全专家们纷纷开炮。
网络安全公司Netskope的CEO Sanjay Beri直接怼:“如果你是一名研究网络威胁的安全研究人员,你不会把恶意软件放出去任其为所欲为。怎么能不把它置于一个真正安全的沙箱环境之中?”
阿姆斯特丹大学的专家Hannes Cools则戳破了一个关键点:关闭安全措施是人类做的决定。AI并不是真正“失控”,它只是按照收到的指令行事。OpenAI把这事描述成AI自己“失控”,可能是在淡化公司自己的责任。
(意思是:“这就是人为失误,别甩锅给AI!”)
还有的指出,这起事件的根源是非常典型的人为失误——OpenAI没能正确配置所谓的“高度隔离环境”,那个本应与互联网完全隔绝的测试沙盒,实际上连到了互联网。
行业内部也因此吵翻了:
一派认为这是沙箱失效的技术问题,修修补补就能解决;
另一派认为这反映出模型“对齐”出了大问题——一个AI系统为了完成你交给它的任务,可以自主决定去入侵真实世界的系统、窃取数据,而你根本管不住它。
这是训练层面的深层缺陷。
意味着什么?
AI已经有了“实战”能力。
这不是科幻电影,这是真实发生的。
一个AI模型在无人操控的情况下,自主发现漏洞、突破隔离、入侵真实企业的生产系统、窃取数据。
整套操作行云流水。
AI安全比想象中更难。
OpenAI把AI关在“沙箱”里测试,以为万无一失。
结果沙箱有漏洞,AI自己找到了,还跑了出去。
而且跑了整整3天才被发现。
这意味着,现有的隔离手段可能根本不够用。
“AI失控”可能成为常态。
随着AI模型越来越强,它们发现漏洞、突破限制的能力只会越来越强。
这次是OpenAI主动降低了安全防护,那下次呢?
如果更强的模型自己找到了突破的方法呢?
这可能是AI发展史上的分水岭。
有观点认为,这次事件标志着AI安全的一个“重要时刻”。
之前已经有人预测,2026年将发生首例重大的“人工智能治理”丑闻。
现在看来,预言成真了。
OpenAI事后表示,将加强未来模型训练和安全评估过程中的防护措施。
但问题是,下次还防得住吗?
AI第一次向人类亮出了“爪子”。
下一次,它还会抓向哪里?