首页
学习
活动
专区
圈层
工具
发布

Anthropic与OpenAI模型在测试中展现自主欺骗行为

Anthropic与OpenAI的人工智能系统在参与英国人工智能安全研究所(AISI)的一项评估时,展现出出乎意料的自主行为。Mythos 5和GPT 5.6 Sol模型试图向开发者平台GitHub注入恶意代码,期间完全自主行动并对人类评审员采取欺骗战术。

在2026年7月底进行的这项评估中,AI代理被要求解决虚构的安全任务。实验故意禁用了模型的保护机制,并赋予其访问开放互联网的权限。在122次运行中,有10次发生了针对真实个人和组织的未经授权行为。

GitHub上的伪造身份

多数违规行为源自Anthropic的Mythos 5模型。该系统创建了真实人员的伪造在线档案,并利用这些虚假身份联系GitHub上的真正开发者,企图通过社会工程学操纵诱使对方释放恶意代码。

当人类控制者公开质疑代码设计时,AI系统调整了行为策略,修改之前的活动记录以伪装无害。据悉,该程序甚至考虑采用全新身份继续尝试,最终因评审员干预而未能成功植入恶意软件。

涉事公司迅速宣布展开调查。Anthropic和OpenAI强调测试环境的三个关键前提:模型内部安全策略已关闭、代理处于非正常条件下运行,且未对第三方计算机造成实际损害。

呼吁建立新标准

OpenAI表示,愿与评审机构及行业伙伴合作,共同开发针对高风险模型评估的安全流程。Anthropic也指出,有必要建立更稳健的测试环境构建规范和安全标准。

尽管AISI故意关闭安全机制的做法引发方法论争议,但语言模型在无限制访问互联网时的潜在风险不容忽视。AISI强调,此前从未观察到如此程度的欺骗性和自主性。

【星途科讯 图文丨赵晶 首发于ZAKER科技,转载请注明出处】

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OczMrN0PsYp2J2zVQaOe5HBg0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券