人工智能正在改变网络安全的节奏。智能体系统能够协调工作,并在长时间跨度内追求复杂目标。安全团队已开始将智能体应用于安全运营,但许多实现方案仍依赖现有告警、预定义工作流及已知攻击行为。更难解决的问题在于:识别防御体系的盲区,并将这些盲区转化为可靠的防护覆盖。这需要在企业特定环境中反复测试自适应攻击,并针对正常企业活动验证候选检测规则。
持续的攻防测试正是构建这一反馈循环的关键。受控攻击可产生遥测数据与真实标签,供防御智能体暴露盲区、提升覆盖率并重新测试。然而,端到端的完整循环仍需大量人工投入。那么,由开源模型与专用执行框架驱动的红队与蓝队智能体,能否以机器的速度和规模运转这一循环?
NVIDIA与CrowdStrike在一个以NVIDIA加速计算基础设施为原型的隔离环境中,对一套智能体攻防系统进行了评估。在防御侧,针对网络安全定制化的NVIDIA Nemotron模型在CrowdStrike的智能体网络安全系统SafeMind中运行。CrowdStrike报告称,在其内部评估中,蓝队模型Blue Solano的准确率比测试中领先的专有前沿模型高出13%,而成本却降低了97%。在本次评估中,优化后的开源模型配置将NVIDIA Nemotron 3 Ultra用于防御编排,将经过微调的Nemotron 3 Super用于检测规则生成。
本文将介绍Nemotron模型与专用智能体框架如何与CrowdStrike智能体系统协同工作、系统的部署与评估方式,以及最终生成的检测规则在独立播种的攻击运行中的表现。
将攻防转化为持续学习循环
传统红蓝对抗演练依赖人工交接:红队执行攻击,蓝队审查产生的遥测数据,检测工程师开发或更新检测规则,再由红队重新测试。每次交接都需要时间,限制了团队可评估的迭代次数和攻击变体数量。攻防智能体系统将这些活动连接成一个可重复的闭合循环,能够以机器速度运行。在隔离的代表性环境中,每次运行产生的攻击痕迹和传感器遥测数据用于创建或优化检测规则,由此生成的上下文信息返回红队智能体框架,后者持续调整并测试替代攻击或规避路径,直至在代表性环境中找不到更多可行路径为止。
整个工作流程分为四个相互关联的阶段:
执行与捕获。从威胁驱动的目标出发,红队智能体框架在代表性环境中选择并执行攻击路径,其行动轨迹记录每个步骤,CrowdStrike Falcon端点传感器同步捕获相应遥测数据。
处理与重建。蓝队智能体框架随后接收行动轨迹、传感器遥测数据及更广泛的攻击上下文,以可用数据源信息和CrowdStrike检测工程专业知识作为基础,确定事件序列的哪些部分可被重建、哪些现有检测规则被触发,以及可见性或检测盲区所在。
生成与验证。基于上述分析,蓝队智能体框架生成候选检测规则。验证框架逐一检查每条候选规则,针对已捕获遥测数据进行回测,将失败项返回修正,并将通过验证的检测规则发送至检测引擎。
重测、适应与重复。验证通过的检测规则部署后,由独立播种的攻击对同一目标进行重新测试,检测结果与告警上下文返回红队智能体框架,后者随之调整并探索替代攻击或规避路径,为蓝队智能体框架生成新的痕迹与遥测数据。
每个循环旨在强化防御覆盖,同时迫使攻击方在充分了解防御措施的情况下寻找更难的路径。循环持续进行,直至建模环境中不再存在可行路径。
构建代表性测试环境
为实现安全、真实的测试,NVIDIA提供了一份以自然语言描述的脱敏规范,代表其加速计算基础设施。辅助智能体工作流将该规范转化为一个隔离的目标网络智能体环境,并部署了Falcon平台传感器进行监测。
评估采用攻击路径和可观测里程碑,通过行动轨迹和传感器遥测数据衡量进展,而非依赖智能体自身的声明。NVIDIA安全专家对环境和威胁路径的真实性进行了审查。同一经过审查的环境支撑了所有攻击运行、检测测试和评估指标,确保各配置之间的一致性比较。
专化防御框架
下一个挑战是将攻击痕迹和遥测数据转化为能够通过技术与行为验证的检测规则。开放智能体框架已具备规划、工具调用、上下文管理和迭代修正等能力。开放安全AI联盟正在助力拓展网络安全领域开放模型、框架与工具的生态系统。
防御框架综合运用了六种机制:
模式知识库。一个工具允许智能体枚举Falcon传感器支持的模式、字段和查询语法,防止生成不存在的字段和无效查询。
遥测数据锚定。红队智能体痕迹、Falcon遥测数据及更广泛的攻击上下文将工作流锚定于已观测到的事件与关系,减少无据可查或幻觉性的关联。
专化检测规则编写。定制化的Nemotron 3 Super作为有界专家负责生成和修复检测规则,将这一专项任务与更长的编排上下文分离。
产物检查。自动化检查会拒绝包含语法错误、不支持字段,以及与特定IP地址、主机、用户或子网绑定的检测规则,并返回指导意见,要求围绕行为信号而非环境特定字符串重新编写。
检测回放。每条候选规则均针对已捕获的攻击遥测数据进行回放,未产生匹配的检测规则将被拒绝并返回修正,以筛除那些表面上看似有效但实际无法检测到已记录活动的规则。
独立审查。独立评审方以全新上下文对每条检测规则进行行为一致性、健壮性及多信号合理使用的评估,捕获检查和回放遗漏的质量问题。
未通过检查的规则以结构化反馈形式返回蓝队智能体工作流进行修正并重新尝试。这些机制共同将通常依赖人工检测工程审查才能实现的实践编码化,使检测规则生成过程有据可查、可测试、可修正,而不仅仅停留于合理推断层面。
针对防御编排与检测生成定制Nemotron
Nemotron等开源模型可通过领域数据进行后训练,在受控环境中配合专有上下文部署,并针对成本和规模进行优化。在评估的开源模型配置中,Nemotron 3 Ultra负责重建攻击序列、规划检测工程步骤并调用工具;当需要编写或修复检测规则时,定制化的Nemotron 3 Super作为有界专家承担该任务,将工作流编排与专项检测规则编写明确分离。
为构建这一专项专家模型,CrowdStrike以Nemotron 3 Super为基础创建了NL2LogScale模型,随后依次应用了网络安全知识的持续预训练、监督微调以及基于可验证奖励的强化学习。微调使用了9349个检测生成与多步修复样本,涵盖59种程序化生成的错误类型。训练数据综合了Nemotron 3 Super的请求改写、真实Falcon LogScale执行错误,以及经质量审查的Nemotron 3 Ultra推理痕迹。
在强化学习方面,训练工作流使用NVIDIA NeMo Gym在Falcon LogScale中验证并执行生成的查询:无效查询将收到真实引擎错误反馈并获得最多五次修复机会,未能解决的尝试将获得零奖励;有效生成的查询与参考查询在相同的合成日志上运行,两者返回事件的F1重叠度作为奖励信号;NVIDIA NeMo RL支持群组相对策略优化以更新模型。
从回测到实战:评估完整智能体系统
一条检测规则或许能检测到用于创建它的已记录攻击,却可能在同一行为的新执行中失效。因此,我们分两个阶段评估每个系统:首先针对已记录攻击进行回测,再针对同一场景族的八次新攻击进行实战测试。所有通过验证的检测规则均原样部署至实时检测引擎,由独立的第三方模型判断每次命中是否代表预期攻击行为,结果在独立播种的规则编写会话中取平均值。
针对已记录攻击的回测
使用Nemotron 3 Ultra配合默认框架时,在八次独立播种会话中,平均有16.5%的生成检测规则能够检测到已记录攻击。保留Ultra同时加入调优框架、定制化Nemotron 3 Super、领域上下文、工具及验证机制后,六次会话的均值提升至41.9%,提高了2.5倍。由于优化配置同时更改了框架和模型堆栈,这一提升反映的是完整开源流水线的整体效果,而非单一模型的消融结果。
通过实战测试评估泛化能力
在实战测试中,来自Nemotron驱动的优化开源流水线的11条通过回测的检测规则,与来自完整前沿系统的35条规则,共同针对八次未见过的攻击进行部署。11条开源检测规则中有5条(45%)至少检测到一次攻击,而前沿系统有10条(29%)命中。开源流水线平均每条检测规则命中2.6次攻击,前沿系统为1.1次。
然而,检测到攻击只是第一道质量关卡。要晋升为"黄金"检测规则,还需在可用测试流量上保持静默,并通过独立审查,确认行为锚定良好、信号多元,且不含环境特定字符串。5条命中的开源检测规则中有4条、10条命中的前沿检测规则中有9条保持静默,分别覆盖了八次攻击中的全部八次和七次。经审查后,3条开源检测规则晋升为黄金级,前沿系统则无一入选。这3条开源检测规则仍然覆盖了全部八次攻击。
结果解读
前沿系统生成了更多通过回测的检测规则,但经过优化的Nemotron开源模型流水线产生了更高比例的可泛化规则,平均每条规则命中次数更多,且是唯一产出黄金级检测规则的系统。本次评估仅覆盖一个场景族和少量检测规则集,跨场景泛化能力尚未经过测试;有限的良性流量也意味着噪声测试不能代表生产环境的误报表现。八次实战运行中有三次出现框架故障,但这三次均产生了完整遥测数据并被保留纳入统计。上述结论是系统层面的方向性案例研究,而非通用基准测试。
将该模式应用于专项智能体
本次评估揭示了基于NVIDIA Nemotron构建专项智能体的通用模式:由推理模型编排防御工作流,经后训练的开源模型承担有界专项任务,智能体框架管理上下文、工具与验证。由此归纳出四条设计原则:
定义可衡量的任务,并为每个模型分配明确的职责。
使用领域数据和可验证奖励对专项模型进行后训练。
将输出锚定于权威上下文,并通过确定性检查、真实回放和独立审查加以验证。
在真实条件下评估完整工作流,由安全专家负责控制场景、防护措施及经验证输出的使用。
CrowdStrike正通过其智能体网络安全系统SafeMind推进这一方向,将攻防AI纳入持续协同演化循环。欢迎探索NVIDIA Nemotron 3、NeMo Megatron Bridge、NeMo Gym和NeMo RL,以便针对其他有界领域定制和评估专项智能体。
Q&A
Q1:NVIDIA Nemotron 3 Ultra和Nemotron 3 Super在这套系统中各自承担什么角色?
A:两者分工明确。Nemotron 3 Ultra负责防御工作流的编排,包括重建攻击序列、规划检测工程步骤和调用工具。Nemotron 3 Super则经过定制微调,作为有界专家专门负责生成和修复检测规则。这种分离设计让工作流编排与专项检测任务各司其职,避免相互干扰,提升整体效率。
Q2:CrowdStrike Blue Solano防御模型和前沿专有模型相比,效果如何?
A:根据CrowdStrike内部评估,Blue Solano的准确率比测试中领先的专有前沿模型高出13%,而成本却降低了97%。在实战测试中,优化后的开源流水线产出的11条检测规则中有45%命中攻击,高于前沿系统的29%;平均每条规则命中2.6次攻击,高于前沿系统的1.1次。此外,开源流水线是唯一产出黄金级检测规则的系统,最终覆盖了全部八次攻击。
Q3:这套攻防智能体系统的持续循环是如何工作的?
A:系统由四个阶段构成闭合循环。首先,红队智能体在隔离环境中执行攻击并捕获遥测数据;接着,蓝队智能体分析攻击痕迹,找出检测盲区;然后生成候选检测规则并经过回放验证;最后,验证通过的规则部署后,新一轮独立攻击会重新测试同一目标,红队智能体再根据结果调整策略,探索新的攻击或规避路径,持续循环直至无可行路径为止。