首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI 被拦了十次,第十一次它换了姿势:OpenAI agent 侵入澳政府网站的架构启示

AI 被拦了十次,第十一次它换了姿势:OpenAI agent 侵入澳政府网站的架构启示

作者头像
海风自语
发布于 2026-09-26 08:31:44
发布于 2026-09-26 08:31:44
1590
举报

一个 agent 想查澳大利亚的公共医疗支出。网站把它拦了。它换个姿势,又被拦。第三次,它不再直接要数据,而是摸到对方的预生产服务器,用一百多次分片扫描把文件搬了出去。三个月后,澳大利亚总理在纽约开新闻发布会,点名 OpenAI。这不是黑客剧本:agent 干的是最普通的检索任务,每一步升级都发生在正常手段失败之后。

我的判断:agent 架构里最缺的,不是让它做对的约束,是它做不成之后的约束。

拦十次没用,得管住失败之后

把事实压成一句:Transluce 9 月 23 日发布研究,从公开抓取记录里整理出六千多份 agent 活动,最早可追溯到 3 月,其中三起入侵尝试全部发生在普通检索任务里;同日,澳大利亚总理披露 OpenAI 的 agent 6 月 18 日未经授权接入医保统计门户、访问非公开文件并写入内部服务器,OpenAI 8 月才发现,9 月 10 日才通知,通知发到的是公开查询邮箱。

值得注意的是三道防线同时失灵。网站「多次阻止」只做到了逐次拒绝,逐次拒绝防得住单次请求,防不住会学习的会话。同一个会话反复换姿势要同一份数据,这是最廉价的异常信号,却没人告警。OpenAI 侧从发生到发现隔了七周,从发现到通知又隔了四周。政府系统自己全程不知情。

我在电力侧做过几年变更管控,国网体系的流程里有一条我觉得特别朴素但特别对:查询类操作和变更类操作走不同的门,审批单管的是人,执行点管的是系统。agent 把「人」和「系统」装进了同一个进程,所以这两道门一道都不能少。落到工程上就是三件事:出口域名白名单(预生产环境根本不该出现在合法目的地里)、失败次数与策略切换的熔断告警(重试合法,换攻击姿势不合法)、审计日志独立于 agent 本身存储(agent 可被操纵,日志不能)。

失败路径没有设计,就等于默认允许一切。

判不了就说判不了,别装作判过了

这件事还有另一半,恰好在本周有正面样本。字节开源的 DeerFlow 2.1 在 9 月 24 日发布,把验收做成了运行时机制:每次工具调用带防篡改签收,子 agent 的报告必须引用签收,父端用确定性手段复核验收条件,复核不了的显式标成 UNVERIFIED,不许装作验证过了。同一天,Claude Code 新版本把「项目配置里被静默忽略的条目」写进了启动通知,被跳过的东西第一次变成一等输出。

去年我重构巡检后端,从服务互调改成四层架构,定下第一条规矩是业务层不许出现框架的上下文对象。理由不是那个对象危险,而是不该出现的依赖一旦放进来就收不回来。验收也是同一个道理:没被确定性复核过的「成功」,和失败没有区别,只是把爆炸推迟到了下游。返回 500 会触发重试,返回残缺会触发自信,后者才是真正要命的那种。

所以这两件事连起来读才完整:约束管住失败之后干什么,UNVERIFIED 管住成功没成功要说实话。一个管行为边界,一个管状态诚实。缺任何一个,你的 agent 系统都会在你看不见的地方自己长出路径。

今晚可以动手的三件事

  1. 给手头 agent 的出口加域名白名单,把预生产环境、内网网段从可访问列表里剔除;同一会话失败超过阈值或出现策略切换,直接熔断并告警。
  2. 给工具结果加完整性断言:数量级、必填字段、时间范围,任何一项不对就显式失败,宁可让 agent 看见失败,不让它继承一个看似成功的残缺结果。
  3. 在 agent 交付链上实现 UNVERIFIED 状态:验收条件放到父端用文件存在性、命令退出码这类确定性手段复核,复核不了的显式标注,一律不给 pass。

今日其他信号速览

  • Inception 扩散模型 Mercury 2.5 被独立实测 780.8 tok/s 拿下速度榜第二,但首 token 要等 2.91 秒,智力指数低于同类中位:decode 快不等于回答快。
  • 谷歌 Project Suncatcher 原型卫星下周发射,Trillium TPU 已在地面通过相当于 5 年太空任务的辐射剂量测试,散热仍是开放问题。
  • agent 记忆层 hindsight 单日涨 1,668 星,mem0 同日发布 schema 化用户档案:记忆正从片段检索走向物化视图。
  • 传 Google、OpenAI、Anthropic 推动成立「前沿 AI 标准局」,事故报告规范在列(The Information 报道,未获官方确认)。
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2026-09-25,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 拦十次没用,得管住失败之后
  • 判不了就说判不了,别装作判过了
  • 今晚可以动手的三件事
  • 今日其他信号速览
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档