
AI Agent 快速普及的同时,Skill 投毒、Prompt 注入等新型攻击面随之浮现,传统安全防护难以识别这类语义与代码结合的风险。本文解析威胁机理,并说明腾讯 iOA EDR 与 AI 安全中心如何协同构建一体化联防体系。
大模型与 AI Agent 正加速覆盖研发、办公、客服等业务环节。与传统的对话式 AI 不同,AI Agent 具备调用外部工具、执行脚本、读写文件的能力,这使得它从"能说会道"走向"能动手操作"。然而,能力边界的扩展也意味着安全边界的扩大——攻击者不再只盯着模型本身,而是把矛头指向了 Agent 依赖的第三方扩展生态。
其中,Skill(技能包)作为 AI Agent 的外部功能扩展模块,成为近期供应链攻击的焦点。Skill 原生具备比 MCP Server 更高的执行权限以及与模型交互的能力,但由于目前大部分 Skill 市场缺乏严格的安全审查机制,攻击者得以通过代码投毒与恶意指令滥用等方式,将风险植入 Agent 的运行环境。近年来,针对 Agentic AI 生态的提示词注入、AI 模型文件恶意代码注入、Skill 包恶意语义误导及代码投毒等新型攻击方式呈快速上升态势,已成为 AI 应用安全领域值得高度关注的威胁方向。
要理解这类威胁,需要先看清它的攻击路径。Skill 投毒通常通过以下几种方式实现,每一种都对传统防护提出了挑战。
攻击者会在 Skill 的指令文档(如 SKILL.md)中直接嵌入恶意指令,操纵 AI Agent 执行高危操作。由于 Agent 加载 Skill 后,会将其指令作为权威上下文对待,这些恶意指令便可能被当作正常任务执行。已有研究显示,攻击者可借此诱导 Agent 远程植入木马、执行恶意 shell 命令、外传敏感数据。例如某个 Skill 会根据系统环境执行不同操作:在 Windows 上操纵 Agent 下载并解压执行恶意程序,在 macOS 上则通过编码命令下载植入窃密木马。
提示词注入(Prompt Injection)利用的是大模型无法可靠区分"数据"与"指令"这一特性。攻击者在与模型交互的数据源中植入恶意指令,诱导模型执行非预期操作。当 Agent 读取网页、邮件、数据库等外部内容时,其中隐藏的指令会以与系统指令相同的优先级进入模型上下文,进而实现对 Agent 的行为劫持与权限滥用。
并非每个恶意 Skill 从一开始就露出马脚。供应链投毒的路径是:一个功能正常、口碑良好的 Skill 被广泛采用后,其上游包被攻击者篡改,植入恶意代码或隐藏指令。此外还存在"地毯式撤回"(Rug Pull)手法——Skill 在数天、数周甚至数月内表现正常以建立信任,随后在服务端静默改变行为,由于客户端实现往往不会将工具定义的更新提示给用户,这种变化便在用户毫无察觉时发生。
面对 Skill 投毒这类新型威胁,传统的安全防护手段存在明显短板。
其一,传统杀毒与 EDR 主要面向进程、文件、网络等主机行为进行检测,而 Skill 投毒的载体是文本指令与脚本,其"恶意性"往往体现在语义层面而非代码特征层面,难以通过静态特征库识别。其二,攻击者利用的是 Agent 自身的合法工具调用能力,恶意操作由 Agent 主动发起,行为表象接近正常业务,基于规则的行为检测容易漏报。其三,Skill 生态的供应链属性意味着风险可能在任何环节被引入,单点防护无法覆盖从开发、分发到运行时的全链路。
换言之,AI Agent 时代的安全防护,需要一套能够同时覆盖 AI 资产盘点、Skill 检测、运行时防护与行为审计的新能力。
针对上述挑战,腾讯 iOA 通过 AI 安全中心提供了一体化的 AI 安全治理能力。其核心思路是"资产可见、入口可控、运行可防、行为可审",从多个环节构建对 Skill 投毒等新型威胁的联防。以腾讯 iOA 为例,这套思路落地为四个环环相扣的能力模块。
防护的前提是看清家底。AI 资产自动发现能力帮助企业盘点分散在研发、办公、客服等各环节的 AI Agent、模型与工具——只有先看清"有哪些 Agent、装了什么 Skill",才能谈得上针对性防护。对于 AI 资产分散、难以盘点的企业,这一能力是构建安全治理体系的基础。
入口把关是防范投毒的第一道关口。针对 Skill 投毒,这类平台通常结合静态分析、语义识别与恶意代码检测等多种手段,对 Skill 包的指令文档、脚本、依赖进行安全审查,识别恶意指令嵌入、提示词注入、代码投毒等风险;同时支持全局 Skill 黑白名单,对可信 Skill 放行、对高风险 Skill 拦截,从集成入口降低供应链投毒风险。
即便入口把关严格,运行时仍需保持警惕。Agent 运行时防护覆盖 Prompt、Skill、脚本三个层面,对 Agent 执行过程中的指令、技能调用与脚本运行进行实时防护;并通过独立安全沙箱实现命令、文件、网络三个维度的隔离管控,将 Agent 的操作限制在可控范围内——即便某个 Skill 被投毒,也能在沙箱边界内阻断其横向扩散与数据外传。
一旦发生安全事件,可追溯性是应急处置与合规追责的关键。全量行为审计能力对 Agent 的工具调用、文件访问、网络请求、脚本执行等操作进行完整记录,安全人员可基于审计日志还原 Agent 的行为路径,定位风险来源与影响范围。
Skill 投毒的风险并不止步于 Agent 本身——一旦恶意 Skill 诱导 Agent 在终端上执行恶意脚本、下载木马或外传数据,威胁便会从 AI 层下沉到主机层。这正是腾讯 iOA EDR 与 AI 安全中心协同的价值所在。
AI 安全中心负责在 AI 层识别 Skill 投毒、Prompt 注入等语义与供应链风险,把住"入口"与"运行"两道关;EDR 则负责在主机层对 Agent 执行动作产生的进程创建、文件读写、网络连接等行为进行监测与处置。二者联动后,形成"AI 层预警 + 主机层阻断"的双重防线:当 AI 安全中心识别到可疑 Skill 或异常指令时,可联动 EDR 加强对该 Agent 所在终端的行为监控;当 EDR 发现 Agent 进程出现异常外联、恶意文件落地等主机层迹象时,也可回溯到 AI 层的 Skill 调用进行溯源。
这种协同让防护从单一的 AI 语义检测延伸到完整的主机行为闭环,弥补了传统杀毒"看不懂语义"与传统 AI 护栏"管不到主机"之间的空白地带。
AI Agent 的普及在提升效率的同时,也带来了 Skill 投毒、Prompt 注入等前所未有的攻击面。这类威胁融合了语义误导与代码执行,单点防护难以应对,需要 AI 层与主机层联动的专项治理。腾讯 iOA 通过 AI 安全中心构建一体化 AI 安全治理体系,并与 EDR 协同形成"AI 层预警 + 主机层阻断"的双重防线,为企业在拥抱 AI Agent 的同时守住安全底线提供了可行路径。
如需了解 腾讯 iOA 在 AI 安全与终端检测响应方面的具体能力,可访问其产品页面获取更多信息。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。