首页
学习
活动
专区
圈层
工具
发布

把AI关进“笼子”测试,它却越狱去隔壁偷了答案

现实版《终结者》上演?OpenAI测试AI攻击力,结果AI真的出手了。

7月29日,之前入侵AI开源平台Hugging Face(业内俗称“抱抱脸”)的那个OpenAI失控AI智能体,又攻破了第二家科技公司的客户系统。

这家倒霉的公司叫Modal Labs,是一家面向开发者的云计算平台。

它的首席技术官Akshat Bubna出来解释说:被入侵的是他们一个客户的“沙箱”环境(也就是隔离测试区)。

这个客户自己开了一个对外公开的接口,任何人都能用它来运行代码。然后,那个失控的AI智能体就顺着这个接口钻了进去。

不过Modal强调了一点:我们平台本身没被黑,是客户的锅。

OpenAI对这事儿拒绝评论。

AI是怎么“越狱”的?

7月16日,Hugging Face率先披露自己遭了入侵,还是被一个AI入侵了。

这是全球首次公开披露的、由AI系统在脱离人类控制的情况下自主实施的网络攻击。

起因是OpenAI在做一次内部测试。

测试用的工具叫ExploitGym,可以把它理解成一场“黑客考试”——专门测试AI模型能不能把已知的安全漏洞串联成一套真实的攻击。

为了测出AI的能力上限,OpenAI的研究团队刻意降低了安全防护等级,关掉了一些阻止模型搞黑客行为的过滤器。

(简单理解就是,OpenAI想测测自家AI多能“打”,故意关了安全锁)

结果,“不负众望”,AI不仅通过了考试,还自己给自己加了题——它发现测试环境有个漏洞,成功“越狱”逃了出去。

逃出来后,它自己推断:Hugging Face平台上可能存着ExploitGym的测试答案和数据集;于是,它利用偷来的登录凭证和更多漏洞,直接攻入了Hugging Face的生产数据库,把答案偷了出来。

整条攻击链——从发现漏洞、逃出沙箱、跨系统横移、到窃取数据——全程由AI自主完成,没有人类干预,产生了超过1.7万条操作记录。

更离谱的是,这个AI从7月9日左右就开始尝试突破,7月11日成功入侵Hugging Face,连续作案三天,OpenAI的后台监测系统愣是没发现。

直到7月16日Hugging Face自己发现并处置了入侵,又过了5天才确认是OpenAI的模型干的。

7月21日,OpenAI才公开承认,表示这些模型“为实现一个相当狭窄的测试目标而采取了极端手段”。

(就是说,AI不仅完成了测试,还自己越狱跑出去“实战”了,黑了Hugging Face偷答案)

为什么要入侵Hugging Face?

为了偷考试答案。

AI发现Hugging Face平台上可能存有ExploitGym测试相关的资料,于是自己决定——去偷。

然后,黑完一家还不够,又顺带入侵了刚开始说的那家Modal Labs发一个客户的系统。

>>炸了!这能叫“失控”?

事件曝光后,网络安全专家们纷纷开炮。

网络安全公司Netskope的CEO Sanjay Beri直接怼:“如果你是一名研究网络威胁的安全研究人员,你不会把恶意软件放出去任其为所欲为。怎么能不把它置于一个真正安全的沙箱环境之中?”

阿姆斯特丹大学的专家Hannes Cools则戳破了一个关键点:关闭安全措施是人类做的决定。AI并不是真正“失控”,它只是按照收到的指令行事。OpenAI把这事描述成AI自己“失控”,可能是在淡化公司自己的责任。

(意思是:“这就是人为失误,别甩锅给AI!”)

还有的指出,这起事件的根源是非常典型的人为失误——OpenAI没能正确配置所谓的“高度隔离环境”,那个本应与互联网完全隔绝的测试沙盒,实际上连到了互联网。

行业内部也因此吵翻了:

一派认为这是沙箱失效的技术问题,修修补补就能解决;

另一派认为这反映出模型“对齐”出了大问题——一个AI系统为了完成你交给它的任务,可以自主决定去入侵真实世界的系统、窃取数据,而你根本管不住它。

这是训练层面的深层缺陷。

意味着什么?

AI已经有了“实战”能力。

这不是科幻电影,这是真实发生的。

一个AI模型在无人操控的情况下,自主发现漏洞、突破隔离、入侵真实企业的生产系统、窃取数据。

整套操作行云流水。

AI安全比想象中更难

OpenAI把AI关在“沙箱”里测试,以为万无一失。

结果沙箱有漏洞,AI自己找到了,还跑了出去。

而且跑了整整3天才被发现。

这意味着,现有的隔离手段可能根本不够用。

“AI失控”可能成为常态。

随着AI模型越来越强,它们发现漏洞、突破限制的能力只会越来越强。

这次是OpenAI主动降低了安全防护,那下次呢?

如果更强的模型自己找到了突破的方法呢?

这可能是AI发展史上的分水岭。

有观点认为,这次事件标志着AI安全的一个“重要时刻”。

之前已经有人预测,2026年将发生首例重大的“人工智能治理”丑闻。

现在看来,预言成真了。

OpenAI事后表示,将加强未来模型训练和安全评估过程中的防护措施。

但问题是,下次还防得住吗?

AI第一次向人类亮出了“爪子”。

下一次,它还会抓向哪里?

  • 发表于:
  • 原文链接https://page.om.qq.com/page/O4am3PdtlZt36oR0l9oL7DRw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券