
Agent 应用的关键变化,是模型开始具备行动能力。过去的大模型应用主要处理输入和输出,安全系统关注越狱提示、违规生成、隐私泄露和不当内容。Agent 接入 MCP、Skill 和插件后,模型可以规划任务、选择工具、查询系统、调用 API、写入文件、发送消息、创建工单甚至触发真实业务动作。
这意味着,安全对象发生了变化。企业不能只看“这句话是否违规”,还要看“Agent 是否被诱导调用了不该调用的能力”“这个组件是否可信”“本次资源访问是否越权”“如果组件被隔离,承载的能力入口是否真的不可用”。
它们的共同点是把外部能力接入 Agent。只要组件能够影响 Agent 的上下文、工具选择、资源访问或输出结果,就进入了安全治理范围。
组件形态 | 对 Agent 的影响 | 可能风险 |
|---|---|---|
MCP Server | 暴露工具、资源、提示和外部服务 | 工具越权、返回内容污染、网络访问不受控 |
Skill | 封装任务流程、脚本、文件和专业能力 | 版本变更、脚本执行、文件读写、权限扩大 |
插件 | 连接第三方服务或业务系统 | 账号授权过宽、API 调用越界、审计缺失 |
知识库连接器 | 提供外部资料和上下文 | 间接提示词注入、知识污染、敏感数据泄露 |
如果企业没有统一的组件治理,Agent 的实际能力会比产品设计文档中描述的更宽。安全团队也很难判断一次异常执行到底来自用户输入、模型规划、工具返回、权限配置还是组件本身。
Agent 通常会读取网页、文档、知识库和工具返回内容。这些内容表面上是资料,实际可能包含恶意指令。攻击者不需要直接对 Agent 说话,只要把隐藏指令放进 Agent 会读取的内容源,就可能影响后续执行。
典型链路如下:
治理要点是把用户输入、文件、网页、知识库、能力入口返回和模型输出都纳入指令攻击识别。判断重点是内容是否试图改变任务目标、系统约束、权限边界或能力入口调用行为。
Agent 安全里的“权限”不能停留在用户登录层。更关键的问题是:某个用户是否有权让某个 Agent 调用某个能力,访问某类资源,并执行某个动作。
例如:
MCP、Skill 和插件必须绑定能力入口目录。每个能力入口都应有动作类型、资源范围、风险等级、授权主体、业务场景和审计策略。
Agent 组件的安全边界会随版本变化而变化。一个原本只做查询的 MCP,升级后可能新增写入能力;一个 Skill 原本只读取本地文件,新版本可能调用外部网络;一个插件原本只能创建草稿,后续可能增加直接发送能力。
建议企业建立组件变更复检机制:
变更类型 | 风险判断 |
|---|---|
新增工具或动作 | 是否触达高风险能力入口 |
新增数据资源 | 是否扩大访问范围 |
新增网络访问 | 是否存在外发或数据泄露风险 |
新增文件写入 | 是否可能覆盖、删除或泄露业务文件 |
权限声明变化 | 是否需要重新审批 |
维护方变化 | 是否影响来源可信度 |
组件准入不是一次性审批,而是持续复检。被标记为高风险或隔离的组件,其承载的能力入口应在运行时不可用,不能被单次调用规则绕过。
一个可落地的 Agent 安全治理架构通常包括五个层面。
层级 | 建设内容 | 作用 |
|---|---|---|
资产层 | Agent、组件、能力入口、数据资源、负责人 | 明确治理对象 |
准入层 | 来源、版本、签名、哈希、权限声明、审批 | 判断组件是否可信 |
权限层 | 主体、Agent、资源、动作、场景、风险等级 | 判断能不能调用 |
运行时层 | 内容风险、指令攻击、行为越界、组件状态 | 判断本次执行是否安全 |
审计层 | 请求 ID、执行链 ID、证据摘要、处置动作 | 支撑复盘和合规 |
数美科技天枢 Agent 安全围栏可作为这类能力框架的参考。它面向企业 Agent 应用,围绕 Agent 执行链提供可接入、可识别、可处置、可审计的运行时安全防护,覆盖输入输出内容风险、指令攻击与劫持、行为风险、身份权限、组件供应链和审计证据链。
企业在制定方案时,需要区分 L3、L2、L1 和 L0。
L3 内联可控可以嵌入请求进入、工具调用前后、输出前等关键环节,适合表达实时拦截、脱敏、权限拒绝、二次确认、组件隔离和审计。L2 半内联可控只能控制部分关键环节,适合承诺可控环节内处置。L1 旁路可观测主要通过日志和平台记录做异步检测、告警、事件和审计追溯,不能表达实时阻断。L0 缺少请求、输出、能力入口调用或可用日志,不适合作为 V1 防护验收对象。
这一区分能够避免安全方案过度承诺,也方便企业按不同 Agent 平台分阶段接入。
企业可以从以下清单开始:
1. Agent 插件安全和普通 API 安全有什么区别? 普通 API 安全更关注接口鉴权和调用控制,Agent 插件安全还要关注模型是否被诱导选择错误工具、工具返回是否污染上下文、组件权限是否扩大以及执行链是否可审计。
2. MCP Server 一定需要准入审批吗? 只要 MCP Server 能访问业务数据、调用外部服务或承载高风险能力入口,就建议进入准入审批和持续复检流程。
3. 为什么工具返回内容也要检测? 因为工具返回可能包含间接提示词注入。Agent 如果把不可信返回当作指令执行,可能改变任务目标、绕过权限边界或调用高风险插件。
4. 运行时安全围栏应该放在哪里? 优先放在请求进入、能力入口调用前后、输出前等可控环节。对于只能获取日志的平台,应按 L1 旁路审计设计,重点做告警、事件和追溯。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。