
摘要
伴随大语言模型安全研究不断推进,部分针对人工智能系统的逃逸攻击手段开始向传统网络威胁场景迁移。2026 年 2 月至 5 月观测到的大规模钓鱼邮件活动,将原本用于大模型提示注入的 ASCII 走私(ASCII Smuggling)技术改造应用于邮件过滤规避,攻击者利用 Unicode 标签区块 U+E0000U+E007F 范围内不可见字符,向贷款、融资类钓鱼关键词内部插入隐形编码,在保持收件人视觉阅读体验不变的前提下,破坏邮件安全设备的关键词匹配、正则特征检测逻辑,实现海量钓鱼邮件绕过防护体系向外分发。本次攻击依托商业营销自动化平台 ActiveCampaign 完成邮件投递,借助平台成熟的 IP 信誉与邮件认证体系进一步削弱基于信誉的过滤能力,工作日单日邮件投递规模最高可达 237 万封,针对小微企业贷款申请者实施信息窃取式钓鱼。本文以该真实攻击事件为研究样本,梳理攻击技术原理、基础设施特征、活动时序规律,对比该技术与传统 Unicode 混淆钓鱼手段的差异,剖析现有邮件安全检测链路存在的结构性短板,反网络钓鱼技术专家芦笛指出,AI 时代攻击手段跨领域迁移已经成为安全领域不可忽视的趋势,传统邮件防护体系需要适配来自人工智能安全领域衍生出的新型混淆技术。本文从内容预处理、异常行为识别、基础设施风险管控、人员安全意识建设多维度提出可落地的防御思路,为企业邮件安全建设提供参考。 关键词:网络钓鱼;ASCII 走私;Unicode 标签字符;邮件安全;攻击逃逸

1 引言
网络钓鱼长期是网络安全领域高频风险,大量数据泄露事件的初始入侵路径均来自钓鱼邮件。随着安全防护技术迭代,传统简单关键词匹配的过滤机制逐步被机器学习、信誉评估、身份认证、语义分析等多层防护架构替代,但攻击者持续更新混淆逃逸手段,以此对抗安全检测机制。在人工智能安全研究领域,ASCII 走私技术最早被用于实现大语言模型的提示注入攻击,依靠不可渲染 Unicode 字符,把隐藏指令嵌入普通文本,人类阅读时无法察觉,而大模型分词器可以完整解析隐藏内容,该技术的相关研究公开之后,攻击者迅速完成技术迁移,将其应用到传统垃圾邮件、钓鱼邮件攻击当中。
微软安全研究团队在 2026 年观测到的大规模钓鱼活动,就是该技术跨域滥用的典型案例。攻击者不再利用 Unicode 标签字符向 AI 模型传递隐藏指令,而是将其插入 “funding” 这类金融诱饵词汇字符间隙,破坏关键词字节连续性。对邮件收件人,邮件文本显示完全正常;对于依赖字面字符串匹配、正则表达式的邮件检测模块,目标关键词字节序列被隐形字符打断,特征规则无法命中,恶意邮件获得绕过检测的机会Microsoft。
该攻击事件的特殊性并不仅仅局限于混淆手段本身。攻击者没有采用自建僵尸网络、恶意邮件服务器的模式,而是滥用成熟 SaaS 营销自动化平台 ActiveCampaign 开展投递。该平台本身具备合规邮件发送资质,SPF、DKIM、DMARC 邮件身份认证可以正常通过,IP 地址具备良好的历史信誉,这就使得依靠发送方信誉、身份认证结果的防护环节出现识别盲区,进一步放大攻击效果。从攻击时序统计数据来看,攻击活动具备极强的工程化特征,工作日大规模投放、周末活动近乎静默,持续三个月的高强度投递之后,在 2026 年 5 月 15 日之后攻击流量显著回落,整套攻击流程已经高度流水线化,能够稳定实现百万级别的邮件输出能力Microsoft。
过往针对 Unicode 混淆钓鱼的研究,更多聚焦于同形字符攻击、零宽字符替换、双向控制字符篡改显示效果等手段,针对 Unicode 标签区块 U+E0000U+E007F 大规模滥用的实战案例分析相对有限。很多企业邮件安全网关在系统设计阶段,没有充分评估该特殊字符区块带来的风险,没有在内容分析之前完成文本归一化处理,造成安全检测逻辑直接面对原始混杂隐形编码的邮件文本,埋下逃逸漏洞。反网络钓鱼技术专家芦笛强调,很多安全建设工作会人为划分 AI 安全、邮件安全的边界,但是攻击者不会遵循安全从业者的领域划分,一项在 AI 对抗场景中诞生的技术,完全可以快速改造用于传统邮件威胁,防御体系也应当建立跨威胁域的全局视角。
本文立足于真实攻击事件,完整还原攻击链路,剖析技术底层机理,区分本次攻击与传统 Unicode 混淆钓鱼的异同,挖掘邮件安全流水线存在的缺陷,形成对应的防御对策,帮助安全从业者理解这类新兴逃逸攻击的危害,为邮件安全系统优化提供现实参考。
2 攻击活动整体概况
2.1 攻击时间线与流量规模
根据微软安全遥测数据,该轮钓鱼攻击最早的异常流量出现在 2026 年 2 月初,2 月 9 日之后邮件投递数量快速抬升,正式进入高流量作战阶段,攻击活动维持大约三个月,在 2026 年 5 月 15 日之后整体流量出现断崖式下降,攻击活动进入低潮期。
攻击者具备非常清晰的时间节律,攻击流量表现出极强的工作日、周末分化。周一至周五开展大规模邮件分发,到周六、周日,攻击活动几乎完全沉寂,周一再度恢复满负荷运行,呈现出人工运营驱动的攻击节奏。工作日单日邮件数量波动区间维持在 100 万至 237 万封,流量峰值出现在 2026 年 2 月 26 日,单日投递量达到 237 万封。如此巨大的邮件体量,说明攻击者已经搭建完成成熟的自动化作业体系,能够稳定调度基础设施执行批量投递任务。
该攻击活动并不是孤立事件,它和 2025 年 9 月 Fortra FIRE 研究团队披露的针对美国小企业管理局 SBA 贷款申请人的钓鱼活动存在关联。早期阶段攻击者同样使用 ActiveCampaign 平台,依靠 AI 生成大量钓鱼邮件与钓鱼网站,目标是收集企业经营、财务层面的详细信息,这些搜集到的情报可以被后续用于高精准度鱼叉式钓鱼攻击。早期活动已经证明攻击者掌握批量生成仿冒网站、批量注册大量主题域名的能力,2026 年爆发的大规模隐形 Unicode 钓鱼,是同一攻击团伙作战能力的延续,只是升级了文本混淆逃逸手段,进一步提升邮件穿透邮件网关的概率。
2.2 攻击诱饵与目标群体
本次钓鱼邮件全部采用金融业务作为诱饵,邮件内容伪装成商业贷款、信用额度、预付款融资业务推广。邮件对外宣称可以为企业提供商业信贷、经营资金支持,瞄准小微企业经营者、小企业贷款申请者群体。攻击者的最终目的包含两类,一类是诱导用户点击邮件内链接,跳转至恶意仿冒网站,窃取企业财务资料、业务信息;另一类是凭据收割,通过虚假表单收集企业联系人身份信息,为后续定向攻击储备数据。
攻击者注册大量一次性主题发送域名,域名字面语义全部围绕融资、资本、商业贷款,例如guardiangrowthfunding.com、digitalcapitalboost.com、thebusinessloanexpress.com等数百个域名,从域名表层文字上营造正规金融服务商的错觉,降低收件人的戒备心理。这些域名仅仅作为邮件发件域名使用,邮件正文内所有跳转链接,并不会直接指向这些域名,全部经过 ActiveCampaign 平台的点击跟踪域名acemlnd.com、activehosted.com完成中转跳转。用户点击邮件内链接时,请求先抵达营销平台跟踪服务器,再重定向到攻击者搭建的仿冒业务网站,该架构同时实现点击行为统计与链路伪装效果。
2.3 投递基础设施的风险特征
攻击者没有控制普通僵尸主机搭建邮件发送集群,而是滥用 SaaS 营销自动化平台 ActiveCampaign 开展分发,该选择是本次攻击中非常关键的设计。从安全过滤的角度,这会带来多重防御难点。
第一,平台本身属于合法商业服务,发送服务器 IP 具备长期积累的正向信誉,SPF、DKIM、DMARC 身份认证校验可以全部通过。很多邮件安全设备会把认证结果、IP 信誉作为重要评估维度,来自可信 SaaS 平台的流量,更容易被判定为正常商业营销邮件,恶意流量混在合法营销流量之中,提升逃逸概率。
第二,平台自带 AI 营销自动化工具,攻击者可以借助平台能力快速调整邮件内容、页面版式,批量生成大量差异化钓鱼邮件,每一封邮件文本、排版存在差异,静态特征签名很难匹配,对抗基于固定特征的检测规则。
第三,链路中引入第三方跟踪域名,原始恶意域名被隐藏在重定向链路后端,邮件正文文本中不会直接出现恶意站点域名,传统的 URL 黑名单拦截效果被削弱,安全设备需要完整解析跳转链,才可以识别最终落地的恶意网页。
ActiveCampaign 官方事后表示,已经针对携带隐形 Unicode 字符的邮件开展内容 moderation 测试,混淆处理后的邮件可以得到和未混淆版本一致的风险判定,系统会将高频使用该类隐形字符作为可疑信号。但平台属于多租户共享服务,攻击者可以通过获取或者盗用普通客户账号发起投递,平台侧很难第一时间区分正常客户业务流量和攻击者滥用账号的行为,基于账号层面的识别存在现实障碍。反网络钓鱼技术专家芦笛指出,滥用合法 SaaS 服务实施攻击已经成为现代钓鱼活动的重要趋势,攻击者不再必须搭建黑灰产专属基础设施,直接借用成熟商业服务的信誉、基础设施完成攻击,给传统基于 IP、域名黑名单的防御体系带来巨大挑战。
3 ASCII 走私技术原理与 Unicode 标签区块分析
3.1 Unicode 标签区块的原始设计与安全隐患
Unicode 标准中 U+E0000 到 U+E007F 这一段编码范围被称为 Tags 标签区块,该区块在设计之初的定位是语言标记用途,区块内部包含一套可打印 ASCII 字符的镜像副本,U+E0041 对应大写字母 A,U+E0061 对应小写字母 a。该设计设想是用来附加文本语言元数据,不需要在显示界面渲染出可见字符。时至今日,该区块功能已经基本废弃,主流操作系统、邮件客户端、浏览器全部不会渲染该区间字符,终端用户完全看不到这些编码的存在,但是这些字符会完整保存在文本字节流当中,文件解析器、邮件解析器、大语言模型分词器仍然会读取、处理这些代码点,这就构成攻击利用的基础条件。
需要明确区分,Unicode 标签区块和常见零宽字符不属于同一集合。零宽空格、零宽连接符等字符,是已经被大量垃圾邮件滥用的不可见字符;而 Tags 标签区块字符是一套完整镜像 ASCII 的特殊编码集合,攻击者可以把任意普通字母对应的标签字符插入原有单词的字符间隙,不需要替换原有字符,原始字符完整保留,仅仅在中间插入隐形编码。
ASCII 走私就是基于该区块衍生出来的技术:把标签区块不可见字符嵌入普通文本,面向人类的渲染输出不会出现变化,但是机器解析原始字节流的时候,隐形代码点真实存在。在最早的 AI 安全场景中,攻击者利用该特性,把提示注入指令藏在文档、网页、邮件文本内部,人类阅读看不到指令,大模型读取文本字节流之后,会读取到隐藏指令,实现模型行为劫持。而本次钓鱼攻击,对技术目标做了改造,不再追求操纵 AI 模型,而是专门用来破坏安全检测的关键词匹配逻辑。
3.2 攻击混淆实现逻辑
攻击者的操作模式十分简洁:选取钓鱼邮件内的核心金融诱饵关键词,例如 funding,在单词内部字符之间插入 U+E0000U+E007F 范围内的标签字符,处理之后文本字节序列变为 fun⟨U+E0020⟩ding。
站在收件人视角,邮件客户端渲染文本时直接丢弃标签区块字符,屏幕上仍然完整显示 funding,阅读感受没有任何异常,诱饵可以正常发挥社会工程效果。
但是邮件安全网关拿到的是完整原始字节流,原始字符串中间混入额外的代码点。如果安全检测采用字面字符串匹配,或者没有做特殊处理的正则表达式,直接在原始字节序列查找连续的 funding 字符串,将无法命中目标,字符序列已经被隐形编码打断。只有当检测流水线预先把全部标签区块字符删除或者归一化之后,再执行关键词、正则匹配,才能够还原出原始关键词,触发告警。
反网络钓鱼技术专家芦笛指出,该攻击并不破坏语义,也不会改变人眼看到的内容,攻击靶点是安全检测流水线的文本预处理环节。很多安全设备的研发逻辑默认输入文本为正常业务文本,没有充分考虑混杂废弃 Unicode 标签字符的对抗样本,直接在原始文本上执行特征匹配,就会留出逃逸缺口。
3.3 与传统 Unicode 混淆钓鱼手段的对比
长久以来,钓鱼攻击已经大量使用各类 Unicode 相关混淆手段,主要分为同形字符攻击、零宽字符插入、双向控制字符篡改显示三类,本次 ASCII 走私标签字符攻击和上述传统手段存在明显差异,厘清相互之间的区别,有助于准确理解威胁的特殊性。
同形字符攻击(Homoglyph Attack):攻击者把原文字符替换为视觉高度近似的其他语种 Unicode 字符,例如西里尔字母替换拉丁字母。字节层面字符完全替换,人眼视觉几乎无法分辨。该手段会直接修改原有字符,而本次标签字符攻击,原始字符全部保留,只是额外插入隐形编码,不存在字符替换操作。
零宽字符攻击:插入 U+200B、U+200D 等零宽字符,同样实现肉眼不可见,打散关键词。二者现象相似,但是编码区块来源不同。零宽字符在部分合法业务场景会存在少量使用,而 U+E0000U+E007F 标签区块现实业务中极少出现,正常企业邮件几乎不会携带该区间编码,它本身是废弃功能区块,出现就属于高可疑指标。
双向控制字符攻击:依靠 Unicode 双向文本控制码,颠倒邮件地址、文本的显示顺序,造成视觉欺骗,它主要作用是篡改视觉展示顺序,并不用于打散关键词,和本次攻击的应用场景完全不同。
从对抗成本角度,标签区块具备完整 ASCII 镜像集合,攻击者可以灵活选择插入的隐形编码,混淆实现门槛低,批量生成对抗样本简单,这也是该手段能够支撑百万级大规模钓鱼活动的重要原因。
4 现有邮件安全防护体系的缺陷分析
完整的邮件安全防护体系一般包含多层防御组件:发送方信誉评估、SPF/DKIM/DMARC 身份认证、恶意域名 URL 黑名单、机器学习语义分类、关键词与正则特征检测、附件沙箱检测等。该轮攻击能够大规模穿透部分防护设备,并不是整套安全体系完全失效,而是部分组件存在短板,不同防护层对该威胁的抵御能力差异巨大。
4.1 文本预处理环节缺失归一化逻辑
该攻击最核心利用的短板就是文本预处理流程不完善。关键词匹配、正则规则是安全设备重要的检测手段,这类规则生效的前提是待检测文本和规则中的目标字符串具备一致的字节序列。很多邮件安全网关,会做常规 Unicode 规范化,但是很多产品的规范化处理只覆盖 NFKC 兼容分解,并没有专门针对 U+E0000U+E007F 标签区块、各类零宽不可见代码点做清除处理,直接将混杂隐形字符的原始文本送入匹配模块。
当隐形标签字符插入关键词中间,字节连续性被破坏,静态规则直接失效。需要注意,该缺陷不是正则表达式书写技巧可以简单弥补,如果没有预先清洗不可见代码点,单纯修改正则,很难穷尽全部插入位置与全部标签字符组合,对抗成本会急剧上升。防御的核心原则应当是 “先归一化,后匹配”,在执行特征匹配之前,把已知的废弃不可渲染代码点全部移除,还原出用户实际看到的文本形态,再运行各类检测规则Microsoft。
4.2 基于发送方信誉与身份认证的防护存在局限
SPF、DKIM、DMARC 可以鉴别邮件发送身份,拦截伪造域名的邮件,但是本次攻击者没有伪造发件域名,直接使用自己注册的域名,通过合法 SaaS 平台完成投递,全部身份认证校验都顺利通过。IP 信誉维度,因为流量来自知名营销服务商,IP 历史信誉良好,单纯依靠认证结果、IP 信誉,无法识别恶意流量。
这反映出一个客观现实:身份认证解决的是 “邮件是不是该域名发出” 的真伪问题,不能解决 “域名本身就是攻击者注册,利用合规服务发送恶意内容” 的场景。很多企业安全建设会过度看重邮件身份认证,把 DKIM/DMARC 通过等同于邮件安全,这是一种认知偏差,身份认证只能防御域名伪造,无法防御攻击者拥有完全控制权的恶意域名与账号。
4.3 静态黑名单机制的滞后性
攻击者注册数百个一次性金融主题域名,域名生命周期较短,批量快速轮换。传统域名黑名单的工作模式,需要安全研究人员发现恶意域名、完成研判、录入黑名单库,存在时间差。在域名被加入黑名单之前,攻击者就可以完成一轮邮件投放。同时邮件正文链接全部经过 ActiveCampaign 跟踪域名重定向,邮件文本不会直接暴露最终恶意站点,单纯解析邮件正文内 URL 只能看到中转域名,安全系统必须完整跟进重定向链路,获取最终落地页面,才可以匹配黑名单,对设备的处理能力提出更高要求。
4.4 机器学习模型的能力边界
机器学习模型在该次事件中,依然拦截绝大多数恶意消息,但并不能做到百分之百覆盖。机器学习模型依靠训练数据集学习恶意邮件的文本特征,如果训练集中缺少大量经过标签字符混淆的对抗样本,模型对混淆之后文本的识别能力会下降。混淆之后,虽然人理解的语义不变,但模型拿到的 token 序列发生改变,输入分布发生偏移,存在被逃逸的可能性。
机器学习是重要防护层,但不能作为唯一防线。反网络钓鱼技术专家芦笛强调,机器学习擅长识别整体语义、行文风格,但是面对专门设计的文本混淆对抗样本,仍然需要预处理、异常特征规则作为补充,多层防护相互兜底,不能把全部希望寄托于单一 AI 模型。
4.5 威胁情报联动的现实壁垒
该攻击横跨多个主体:攻击者注册的恶意域名、第三方 SaaS 营销平台、攻击者搭建的钓鱼网站。安全厂商获取威胁指标之后,很难直接对 SaaS 平台内部账号行为进行管控。安全厂商只能在邮件到达企业边界之后开展检测,无法在源头阻止攻击者滥用 SaaS 账号。服务商侧和企业侧的威胁情报很难高效互通,企业安全团队只能被动在邮件网关层面进行事后检测拦截。
5 分层防御体系构建
针对 Unicode 标签字符驱动的 ASCII 走私钓鱼威胁,不能依靠单一手段实现防护,需要构建多层防御,覆盖邮件网关预处理、异常特征识别、基础设施风险管控、业务侧配置、人员意识多个维度,形成完整防御闭环。
5.1 邮件安全流水线完善文本归一化处理
所有执行关键词匹配、正则检测、文本分类的处理环节,必须在检测动作执行之前完成文本预处理。预处理阶段,对邮件主题、邮件正文全部文本,主动清除 U+E0000U+E007F 整个 Unicode 标签区块全部代码点,同时清理各类零宽、非渲染控制字符。完成清洗之后,再把归一化后的文本送入后续检测逻辑,还原出终端用户实际看到的文本内容,消除隐形字符对特征匹配的干扰,落实 “先归一化,后匹配” 的核心防御原则。
企业应当对自身正在使用的邮件安全网关开展对抗测试,构造插入标签区块字符的测试邮件,验证产品预处理逻辑是否生效,确认在混入隐形标签字符的条件下,原有关键词、正则规则仍然可以正常告警。不同厂商产品的 Unicode 处理逻辑存在差异,纸面参数无法完全确认防护能力,必须通过实际对抗测试验证防护有效性。
5.2 将异常 Unicode 字符作为独立风险特征
U+E0000U+E007F 标签区块属于废弃功能区块,正常商业邮件场景极少出现该区间字符。邮件安全系统可以将该区间字符的出现作为高可疑异常信号。当邮件主题或者正文检出该区块代码点,无论内容是否命中其他恶意规则,都提升邮件风险评分,结合邮件发送源、邮件主题、链接情况综合判定,进行隔离或者人工复核。
该策略可以弥补归一化处理可能存在的遗漏,即便未来出现新的不可见混淆编码,异常字符统计、字符占比分析的思路依然具备参考价值。不建议直接单纯依靠该特征做直接阻断,避免极罕见合法场景出现误报,适合作为风险评分因子,和其他威胁信号加权综合判断。
5.3 弱化对单一信誉、身份认证指标的依赖
企业应当纠正 “DKIM/DMARC 通过即为安全” 的认知偏差。SPF、DKIM、DMARC 主要用于抵御域名伪造,无法防御攻击者自有域名、滥用 SaaS 服务投递恶意邮件。邮件安全评估过程中,身份认证结果只能作为众多评估因子中的一项,不能作为放行依据。
对于来自大型营销 SaaS 平台的邮件流量,需要给予特殊关注。该类流量 IP 信誉普遍较好,但是存在被攻击者盗用账号的风险。安全设备需要深度解析邮件内部的 URL 跳转链路,跟随重定向获取最终落地网页,对最终页面开展内容检测,不能只检测邮件正文直接出现的链接。同时收集该类邮件的行文、诱饵、表单特征,建立专门针对 SaaS 平台投递钓鱼的检测规则。
5.4 多威胁情报源联动,缩短恶意域名处置时间
攻击者大量使用短期存活的一次性域名,黑名单天然存在滞后。企业安全团队需要多源获取钓鱼基础设施 IOC 指标,及时更新邮件网关、DNS 网关的黑名单规则。同时关注安全厂商发布的攻击活动报告,在大规模攻击爆发阶段,调高同类主题邮件的风险阈值。
需要明确,黑名单只能处置已经被发现的恶意资产,面对攻击者新注册的未知域名无法生效,黑名单只能作为辅助手段,不能替代内容层面的检测。
5.5 终端侧与业务侧的补充防护
除邮件网关之外,终端浏览器、办公文档处理程序同样会接触携带各类特殊 Unicode 字符的外部内容。企业终端安全策略中,应当对外部来源文档、网页内异常 Unicode 字符增加审计日志,当业务系统接收外部文本输入时,同样执行不可见字符清洗,避免混淆内容从邮件向外扩散到其他业务系统。
企业内部部署的大语言模型应用,同样需要警惕 ASCII 走私带来的提示注入风险,外部输入文本在送入大模型之前,也需要清理 U+E0000U+E007F 标签区块字符,防范同源技术衍生出来的 AI 劫持风险。反网络钓鱼技术专家芦笛认为,同一个混淆技术,既可以攻击邮件系统,也可以攻击大模型应用,企业安全建设应当打通不同业务系统的风险处置逻辑,一套字符清洗逻辑可以复用到邮件、文档解析、大模型输入等多个场景。
5.6 人员安全意识培训的侧重点优化
该类攻击邮件,经过混淆处理之后,文本本身没有乱码,行文模仿正规商业融资推广,普通用户很难从文本格式上发现异常。针对该类威胁,安全意识培训不应当教导员工识别看不见的特殊字符,人的肉眼本身无法完成识别。培训重点应当聚焦行为层面:非主动申请的商业贷款、融资类邮件,不要直接点击邮件内链接;涉及企业财务、业务信息填写,不要在邮件点击跳转而来的网页提交资料;对陌生商业推广邮件保持审慎,需要核验服务商身份,使用独立浏览器手动访问官方网站,而不是点击邮件内链接。
人的能力边界需要客观看待,用户无法分辨字节流层面的隐形编码,防御该威胁的主力是技术防护体系,人员意识是最后兜底防线,不能把技术缺陷的防御责任转嫁到终端使用者身上。
6 威胁发展趋势研判
从本次攻击事件可以观察到一个非常明确的安全趋势:针对人工智能系统的对抗技术会快速向传统网络攻击场景迁移。ASCII 走私最早是 AI 安全领域的研究课题,公开之后短时间内攻击者就改造为邮件逃逸手段。未来,更多针对大模型的对抗方法,都有可能被攻击者改造用于钓鱼、垃圾邮件、恶意文档,安全防御的边界正在被打破。
攻击者的基础设施选择也会持续偏向滥用合法 SaaS 平台。相比维护黑灰产服务器,租用、盗用普通 SaaS 账号,能够继承平台的信誉、邮件认证能力,攻击成本下降,检测难度上升,该模式会成为高规模钓鱼活动的优选方案。
混淆手段本身也会持续迭代。本次攻击者主要使用 U+E0000U+E007F 标签区块,后续攻击者还可能挖掘 Unicode 标准中其他废弃、极少使用的非渲染代码点,开发新的混淆手段。对抗的关键点不在于穷尽每一类恶意字符,而是建立标准化的文本归一化流程,在检测之前完成对非预期特殊编码的清洗,从流水线层面消除混淆的基础条件。
同时该事件也提醒安全产品研发人员,安全检测系统不能无条件信任输入文本就是人类肉眼所见文本。外部输入文本全部属于不可信来源,原始字节流和可视化展示文本之间,可能存在巨大差异,所有文本检测逻辑,都必须充分考虑 Unicode 带来的复杂攻击面。
7 结语
本文以 2026 年大规模 ASCII 走私钓鱼邮件事件为研究对象,还原攻击活动全貌,解析 Unicode 标签字符实现逃逸的技术机理,对比该技术与传统 Unicode 混淆钓鱼的差异,剖析邮件安全防护体系在文本预处理、信誉机制、黑名单机制等方面存在的短板。反网络钓鱼技术专家芦笛指出,AI 安全和传统邮件安全不再是相互割裂的两个领域,攻击者会自由跨域复用攻击技术,安全防御体系也必须建立全局视角,才能跟上威胁演变节奏。
该攻击的核心漏洞,并不是出现了某种无法破解的全新攻击算法,而是大量安全检测流水线没有完成完备的文本归一化,直接在原始混杂特殊编码的字节流上开展特征匹配,给攻击者留下逃逸窗口。对应的防御思路清晰可行:检测前完成文本清洗归一化,将异常 Unicode 字符纳入风险评分,弱化对单一信誉指标的依赖,完善链路解析能力,同时做好终端、业务系统的配套防护,辅以合理的人员安全意识建设,构建多层互补的防护架构。
威胁不会就此终止,攻击者还会继续挖掘 Unicode 体系中的各类边角特性,改造更多对抗手段。对于安全从业者来说,需要跳出单一攻击样本本身,理解攻击背后的底层逻辑,优化安全流水线的基础处理流程,而不是仅仅针对本次攻击编写临时规则。只有加固底层处理环节,才能够对未来同类混淆攻击形成通用性抵御能力。
编辑:芦笛(公共互联网反网络钓鱼工作组)
来源:迪妙网络空间安全学院
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。