
摘要
随着邮件安全防护体系向人工智能驱动的检测架构演进,威胁攻击者开始将面向大语言模型的对抗手段迁移至传统邮件钓鱼场景。ASCII 走私(ASCII smuggling)技术利用 Unicode 标签区块不可见字符,在不改变人类阅读视觉效果的前提下割裂文本关键字,同时干扰传统特征匹配与大语言模型分词解析流程,实现对邮件安全网关的绕过。本文以微软 2026 年监测到的大规模金融诱饵钓鱼攻击事件为研究样本,梳理 ASCII 走私技术的技术实现逻辑,对比其与传统文本加盐混淆手段的差异,剖析该攻击活动的基础设施、传播时序、行为特征,分析其对签名规则、机器学习分类器、大语言模型扫描组件带来的现实挑战。结合攻击样本的技术特征,从文本预处理、多维度特征关联检测、多模态校验、第三方平台滥用治理、组织侧安全运营多个层面提出可落地的防御路径。反网络钓鱼技术专家芦笛指出,AI 对抗技术向传统网络钓鱼场景迁移已经成为确定性趋势,防御体系不能仅依赖单一内容检测能力,必须构建字符预处理特征规则上下文可视化校验的闭环防护链条。研究表明,单纯依靠模型迭代无法抵御此类字符级对抗扰动,文本归一化预处理是阻断 ASCII 走私攻击的基础前提,相关研究结论可为企业邮件安全网关的策略优化、威胁狩猎工作提供参考依据。
关键词:邮件安全;网络钓鱼;ASCII 走私;Unicode 混淆;对抗检测;邮件过滤

1 引言
网络钓鱼长期是企业组织面临的高频网络安全风险,邮件作为钓鱼攻击最主要的传播载体,安全防护技术历经基于签名特征、信誉评估、机器学习分类,逐步演进到大语言模型辅助检测的技术路线Microsoft。传统邮件安全网关依靠正则匹配、关键字特征、发送方信誉、URL 沙箱等多重能力识别钓鱼邮件,在过往对抗实践中积累大量成熟防护经验。但是威胁攻击者持续挖掘文本编码层面的对抗空间,各类不可见 Unicode 字符混淆手段不断出现,用以破坏安全设备的文本解析逻辑,达成绕过检测的目标。
ASCII 走私技术最早作为提示词注入攻击手段被安全业界关注,原本用于向大语言模型隐藏恶意指令,诱导模型执行非预期行为。2026 年 25 月微软安全研究团队观测到大规模钓鱼邮件活动,攻击者将 ASCII 走私技术迁移到批量邮件钓鱼场景,不再用于注入 AI 提示指令,而是将 Unicode 标签区块字符插入钓鱼诱饵关键字内部,直接破坏邮件过滤引擎的关键字匹配与分词处理逻辑,实现大量恶意邮件穿透安全防护体系到达用户收件箱。该攻击活动单日恶意邮件峰值达到 237 万封,具备工作日批量投递、周末流量显著回落的规模化调度特征,依托合法邮件营销平台 ActiveCampaign 完成邮件分发,进一步模糊恶意流量的信誉边界,提升检测难度。
该事件暴露出当前邮件安全体系存在的两类现实短板:第一,大量安全检测流程未对特殊 Unicode 标签区块字符做前置清洗,原始文本直接送入特征匹配与 AI 分析模块,攻击者可以借助字符级扰动破坏检测逻辑;第二,面向大语言模型的对抗攻击手段正在快速向传统黑产钓鱼生态流转,威胁组织复用成熟对抗技术,不需要复杂漏洞利用,仅依靠文本编码层面的操作即可实现大规模绕过,攻击实施门槛较低。
现有公开研究更多聚焦 ASCII 走私在大模型提示注入场景的危害,针对其落地到大规模邮件钓鱼场景的完整技术链条、攻击基础设施特征、体系化防御方案的系统性分析相对有限。本文基于微软公开的攻击事件完整观测数据,客观还原该攻击活动完整链路,厘清 ASCII 走私与传统文本加盐类混淆技术的技术边界,分析不同检测组件遭受的干扰机理,同时结合攻击的基础设施特征,提出分层落地的防御方案。本文不做夸大式风险渲染,客观承认防御手段存在的边界与局限,为邮件安全设备研发人员、企业安全运营人员提供技术参考。
2 ASCII 走私技术基础原理与同类混淆技术对比
2.1 ASCII 走私技术核心机理
ASCII 走私的核心本质是利用特定 Unicode 编码区块的渲染与解析不一致性,制造人类视觉可见文本与底层程序解析文本之间的信息错位。本次攻击所滥用的 Unicode 标签区块编码范围为 U+E0000 至 U+E007F,该编码区块最初设计用于语言标记功能,目前已经处于废弃状态。该区块内部每一个编码点对应一份可打印 ASCII 字符的 “影子副本”,在主流邮件客户端、网页邮件界面中,该系列编码字符不会产生任何可视化渲染效果,人类阅读邮件时完全感知不到字符存在;但是邮件解析程序、正则匹配引擎、大语言模型分词器会完整读取底层文本流中该编码字符,将其作为独立字符参与文本处理流程Microsoft。
攻击者的操作逻辑为,在钓鱼诱饵关键字的字母缝隙之间插入该区块的不可见标签字符。以钓鱼场景高频关键词 “funding” 为例,在字母之间插入 U+E0000 系列字符之后,屏幕展示依旧是完整单词 funding,但是底层文本序列已经被不可见字符切割为多段子串。传统基于完整字符串匹配、正则表达式的签名规则,无法命中被字符割裂后的碎片化文本,签名检测直接失效。对于大语言模型驱动的邮件扫描组件,分词器会依据文本原始字符序列执行切分,不可见标签字符会强制打断原有单词的 token 边界,模型无法识别出原本的高风险诱饵词汇,进而降低邮件的恶意判定分数,实现绕过 AI 检测机制的效果。
需要明确区分该技术的原始用途与本次攻击的改造目标。在早期 AI 安全研究中,ASCII 走私主要目标是隐藏恶意提示指令,对人类隐藏指令内容,让大语言模型读取并执行隐藏指令。而 2026 年观测到的钓鱼 Campaign 完成攻击目标转换:攻击者不再隐藏 AI 指令,而是专门破坏安全检测工具的文本解析,面向邮件过滤引擎制造解析障碍,面向普通受害者维持正常可读的钓鱼诱饵文本,这是该技术从 AI 对抗领域向传统钓鱼黑产迁移的关键变化。
反网络钓鱼技术专家芦笛强调,ASCII 走私的威胁根源并非操作系统、邮件客户端存在软件漏洞,而是不同组件对于同一套 Unicode 文本流处理逻辑存在差异,攻击者利用这种处理逻辑的差异构建对抗空间,这一类对抗手段不依赖漏洞利用,仅依靠文本编码层面的构造,攻击适配范围广,对各类文本检测系统均存在潜在威胁。
2.2 与传统文本加盐(text salting)技术的对比
在 ASCII 走私大规模应用之前,文本加盐已经是钓鱼攻击者广泛使用的混淆绕过手段,同样依靠插入不可见字符实现对抗,二者存在行为表象的相似,但是底层滥用的编码资源、攻击效果、对抗边界存在明显差异,需要做清晰区分,避免安全运营过程中特征误判。
传统文本加盐技术常见使用零宽空格 U+200B、不间断空格 U+00A0,还有 CSS 样式操控实现字体大小置零、文字与背景同色等实现隐藏混淆效果。零宽空格 U+200B 属于通用零宽字符集合,在正常业务场景依旧存在合理使用场景,例如部分排版软件用于单词换行处理,正常邮件流量中会小概率出现该类字符。而 U+E0000U+E007F 标签区块,合法使用场景非常有限,仅少数国旗 emoji(英格兰、苏格兰、威尔士旗帜 emoji)会用到该编码区块特定组合,除此之外普通业务邮件几乎不会出现该编码集合的字符,该特征具备很高的异常置信度,适合作为威胁狩猎的告警信号。
从对抗效果维度看,零宽字符同样可以割裂关键字,绕过正则匹配,但是主流 Unicode 归一化处理接口对于零宽字符具备较好的适配处理经验,大量安全设备已经预置对 U+200B 等经典零宽字符的清洗逻辑。与之相对,U+E0000 系列标签字符不在常规归一化处理覆盖范围之内,很多邮件安全网关的预处理流程完全没有覆盖该编码区块,原有清洗逻辑失效,这也是本次攻击能够形成大规模穿透的重要原因。
从实现形态上,传统文本加盐分为字符插入混淆与 CSS 样式隐藏两大分支,CSS 类加盐依赖 HTML 邮件的样式标签,纯文本格式邮件环境下攻击效果会大幅衰减。ASCII 走私依托原始文本流编码完成混淆,HTML 邮件、纯文本邮件格式都可以生效,不依赖 HTML 标签与 CSS 样式,攻击适配场景更广。
两类技术的对比如下表所示:
表格
技术类型 | 主要滥用编码 | 合法业务出现概率 | 依赖 HTML/CSS | 主流归一化覆盖情况 |
|---|---|---|---|---|
ASCII 走私(标签区块) | U+E0000U+E007F | 极低,仅特定旗帜 emoji 场景 | 否,纯文本即可生效 | 大部分安全网关未做处理 |
传统文本加盐(零宽字符) | U+200B、U+00A0 | 较低,少量排版场景存在 | 部分场景不需要 | 多数设备具备清洗逻辑 |
CSS 文本加盐 | 字体、颜色、overflow 样式 | 不涉及编码,依赖 HTML 标签 | 是,必须 HTML 格式 | 依靠 HTML 解析检测 |
2.3 攻击对不同邮件检测组件的干扰机理
现代邮件安全网关是多层检测架构,包含规则签名模块、传统机器学习分类模块、大语言模型扫描模块、信誉评估模块,ASCII 走私技术对不同模块产生的干扰效果并不相同,需要分层拆解。
第一,基于字符串匹配、正则表达式的签名检测模块。该类模块的检测逻辑依赖完整连续的关键词序列,当不可见标签字符插入单词内部,原始连续字符串被切割,正则表达式无法匹配目标关键字,签名规则直接失效。这是该攻击最直接的破坏效果。
第二,传统机器学习邮件分类模块。传统机器学习大多基于词袋、ngram 文本特征进行样本训练,特征提取阶段直接读取原始未清洗文本流。插入标签字符之后,原始单词被拆分为多个子片段,原本训练集中的高危词特征无法被提取,样本向低风险类别偏移,分类模型输出的恶意评分被降低,实现绕过。
第三,大语言模型驱动的邮件扫描组件。大语言模型依靠 tokenizer 分词器把邮件文本切分为 token 序列,再送入模型做意图推理。当文本流中插入 U+E0000 系列字符,分词器会把不可见编码识别为独立 token,强制切割原有单词的 token 边界,完整钓鱼诱饵关键词被拆分成互不关联的 token 片段。模型无法组装还原出完整高危词汇,难以识别邮件的钓鱼欺诈意图。值得注意的是,该攻击不是攻破大模型本身的推理能力,而是在输入侧破坏输入文本的 token 序列,属于输入层面的对抗扰动,模型本身权重参数没有遭到篡改。
第四,发送方信誉、IP、域名信誉评估模块。ASCII 走私属于邮件内容层面的混淆手段,不会改变邮件信封、发送 IP、域名的相关特征,信誉检测模块本身不会被该技术直接绕过。攻击者可以通过选择信誉良好的第三方邮件营销平台发送邮件,借助平台本身的 IP、域名信誉规避信誉维度拦截,将内容混淆与基础设施选择两种手段组合使用,放大攻击的整体穿透能力。
3 2026 大规模 ASCII 走私钓鱼攻击活动样本分析
3.1 攻击活动时间线与流量规模特征
微软安全团队的该攻击活动发现源自针对 Office365 Defender 的提示注入防护研究工作,安全人员配置的狩猎签名原本用于发现 ASCII 走私提示注入行为,实际观测到大量非提示注入类的钓鱼邮件命中该签名,由此发现这一轮大规模金融诱饵钓鱼活动。
攻击活动流量从 2026 年 2 月初开始抬升,2 月 9 日检测数据显示携带 ASCII 走私字符的邮件数量从每日 500020000 的基线规模暴涨至单日 130 万封。流量在 2 月 26 日到达峰值,单日检测到 237 万封携带该混淆特征的恶意邮件。高流量周期持续到 2026 年 5 月 15 日之后,整体攻击流量出现明显回落。该攻击具备非常典型的商业黑产批量投递特征:工作日维持高位邮件投递量,周末检测数量出现显著下跌,呈现稳定周度循环的投递节奏,可以判断攻击者使用调度化批量投递任务执行邮件分发,并非零散个体攻击者的随机行为。
虽然该轮攻击在 5 月中旬流量回落,但该钓鱼行动本身并不是随混淆手段消失而终止。研究人员溯源确认,该钓鱼组织在 2025 年 9 月就已经被 Fortra 安全机构标记,属于长期持续运作的金融诱饵钓鱼团伙,ASCII 走私只是该团伙阶段性使用的绕过手段,混淆手段消失之后,该团伙大概率会迭代其他混淆技术继续开展攻击,不能将该轮攻击流量回落等同于威胁彻底消除。
3.2 攻击诱饵主题与社会工程逻辑
该钓鱼活动全部采用金融融资类诱饵主题,面向企业商业场景开展社会工程欺骗。邮件内容围绕商业融资、资金扶持、业务授信、商业资本助推等叙事展开,目标瞄准企业经营管理人员,利用中小企业对融资渠道的需求诱导受害者点击邮件内恶意链接。
攻击者构造大量主题相关的发送方域名,20 个活跃度最高的发送域名,均由 28 个固定业务词汇组合生成,包含 advance、boost、business、capital、catalyst、choice、digital、direct 等词汇,生成类似digitalcapitalboost.com这类组合式域名,营造出正规商业资本服务商的虚假观感,降低收件人的警惕心理。邮件正文表面上是正规商业推广邮件,文本内部的 “funding”“capital” 这类金融高频风险关键词缝隙中,批量插入 Unicode 标签区块不可见字符,破坏安全设备的关键字检测,普通用户阅读时看不到任何异常,只能看到完整通顺的商业推销文本。
3.3 攻击分发基础设施特征
该团伙没有搭建自有邮件发送集群,而是滥用合法商用邮件营销平台 ActiveCampaign 完成批量邮件投递,这是该攻击活动重要的基础设施特点,极大提升防御检测的复杂度。
使用第三方营销平台带来多重攻击收益:第一,平台本身 IP 地址具备较高的邮件发送信誉,SPF、DKIM、DMARC 等邮件身份认证机制可以正常通过,传统基于发送源信誉的拦截手段效果被削弱;第二,平台自带 URL 重写追踪能力,邮件内的恶意目标链接会被平台自动改写为平台自有追踪域名,邮件中看到的链接地址为activehosted.com、acemlnd.com等追踪域名,原始恶意落地地址被隐藏,安全网关直接解析邮件正文链接无法直接拿到原始恶意 URL;第三,该平台存在共享发送 IP 池,大量正常商业营销邮件与钓鱼邮件共享同一批 IP 资源,直接封禁 IP 段会误伤大量正常业务邮件,基础设施层面无法简单依靠 IP 封禁完成处置。
从观测到的样本统计数据来看,98.5% 的攻击邮件信封发件域名符合 ActiveCampaign 共享发送池命名范式,即 acems + 数字、emsd + 数字格式域名;92% 攻击邮件来源于 173.236.20.0/24 网络地址段。微软研究报告着重提示,上述基础设施特征属于第三方营销平台的公共属性,不是该威胁团伙独有的 IOC,不能单独把上述特征作为恶意判定依据,只可以作为辅助佐证信号,需要结合邮件内容层面的混淆特征、诱饵主题做多信号联合判断,避免产生大量误报,干扰正常业务邮件流转。
ActiveCampaign 官方针对该攻击事件对外发布声明,平台已经针对该类字符混淆行为优化内容审核体系,携带不可见 Unicode 字符的消息会获得与清洗之后等价的审核判定结果,大量使用该类混淆字符本身会被标记为可疑行为,平台持续迭代账号生命周期阶段的滥用行为识别能力。但第三方平台的内容审核存在客观时延,威胁攻击者仍然可以利用账号注册到平台识别封禁之间的时间窗口完成批量邮件投递,企业侧依旧不能完全依赖平台方的安全能力,自身邮件网关检测能力不可缺失。
3.4 攻击完整行为链路还原
综合公开观测数据,完整攻击链路可以梳理为如下环节:
威胁攻击者注册 ActiveCampaign 平台账号,准备批量钓鱼邮件模板,在模板的金融诱饵关键字内部批量插入 U+E0000U+E007F 标签区块不可见字符,完成文本混淆;
攻击者批量注册大量金融主题相关的发送域名,配置域名解析、邮件身份认证记录,依托平台的共享发送 IP 池,按照工作日调度任务批量向外投递钓鱼邮件;
邮件经过邮件传输网络抵达目标企业邮件网关,邮件网关读取原始未清洗文本流,正则签名、AI 分词模块被不可见字符干扰,部分邮件绕过内容检测进入用户收件箱;
收件人看到视觉上正常的商业融资推销邮件,点击邮件内链接,链接经由 ActiveCampaign 追踪域名跳转,访问攻击者控制的恶意落地页面,后续开展诈骗、信息窃取等后续恶意行为;
攻击流量随调度脚本在工作日维持高位,周末暂停投递,当平台识别账号滥用之后,攻击者切换新账号、新域名继续开展同类攻击。
整个攻击链路可以看出,该威胁是 “文本编码混淆 + 合法第三方平台滥用 + 金融主题社会工程” 三者结合形成的复合威胁,仅仅解决其中单一环节,无法完整阻断攻击链条。
4 ASCII 走私钓鱼攻击的防御难点分析
通过对攻击事件完整复盘,可以梳理出当前邮件安全体系面对该类攻击存在几处现实防御难点,理解难点才能够针对性设计防御策略,避免提出脱离工程实际的理想化防护方案。
第一,Unicode 字符集合的处理存在业务兼容性矛盾。U+E0000U+E007F 标签区块并非全部字符都属于恶意场景,英格兰、苏格兰、威尔士的旗帜 emoji 会使用该编码区块特定组合。如果直接粗暴全盘删除该编码区块所有字符,会造成正常旗帜 emoji 显示异常,产生业务误损伤。防御逻辑需要识别并放过合法 emoji 组合,清除其余场景下的标签区块字符,该逻辑增加预处理模块的开发复杂度。除此之外,零宽空格、不间断空格等其他混淆字符,在少数正常排版场景存在合理用途,全部直接删除也会带来少量正常邮件的内容损坏风险,预处理环节需要权衡安全收益与业务兼容性。
第二,传统检测与 AI 检测都建立在文本输入可信的前提假设之上。绝大多数邮件安全检测逻辑默认:程序解析读取的文本,等价于人类邮件客户端渲染展示给用户看到的文本。ASCII 走私技术正是打破这个假设,构造底层文本流与可视化文本不一致的输入样本。不管是规则引擎还是大语言模型,只要直接送入未做预处理的原始文本,就会面临被对抗扰动干扰的风险。很多安全厂商的研发重心放在模型算法迭代,却忽视输入文本的预处理归一化环节,造成防护体系存在底层短板。反网络钓鱼技术专家芦笛指出,很多安全团队在做 AI 邮件安全建设时过度看重模型效果指标,却低估输入预处理这一基础环节的安全价值,字符级对抗扰动可以直接抵消模型训练迭代带来的防护收益。
第三,攻击者借助合法第三方平台消解信誉防御能力。如果威胁攻击者使用自有恶意 IP、恶意域名发送钓鱼邮件,依靠 IP、域名信誉库就可以实现大量拦截。但是当攻击者滥用成熟营销 SaaS 平台,邮件通过平台正规基础设施投递,SPF/DKIM/DMARC 全部校验通过,IP 与域名本身属于正常服务商资产,信誉维度很难直接做拦截,防御压力会全部转移到邮件内容检测环节。一旦内容检测被 ASCII 走私绕过,邮件就可以直达用户。同时直接封禁平台 IP 池会带来严重误杀,基础设施层面的处置手段受到极大约束。
第四,攻击手段具备快速迭代迁移能力。ASCII 走私技术原本是 AI 提示注入对抗手段,短时间内就被黑产团伙改造用于邮件钓鱼。同类逻辑,后续其他面向大模型的对抗样本技术,都有可能被迁移到邮件钓鱼、垃圾邮件场景。防御不能只针对当前这一组 U+E0000 标签字符做单点特征修复,需要建立一套通用的不可见字符对抗处理框架,面向未来同类编码混淆攻击预留处理能力。
第五,告警信号存在单独使用的局限性。U+E0000 区块字符的出现是高置信度异常信号,但是不能单独作为拦截依据。除旗帜 emoji 合法场景之外,还存在少量第三方特殊业务系统输出邮件携带该编码字符的边缘业务场景。单独依靠该字符直接拦截邮件,会产生业务误报。该信号更加适合作为高权重告警特征,需要和诱饵主题、URL 特征、发送行为等其他信号做关联融合,实现多维度联合判定。
5 面向 ASCII 走私钓鱼攻击的分层防御体系构建
结合攻击技术机理、攻击活动特征以及防御现实难点,本文从文本预处理、多维度检测、多模态校验、第三方平台风险治理、安全运营与人员能力五个层面构建分层防御方案,兼顾安全防护效果与业务系统兼容性。
5.1 邮件文本前置归一化预处理
文本预处理是阻断 ASCII 走私攻击最基础、最关键的一环,所有进入签名规则、机器学习、大语言模型分析的邮件文本,必须先完成预处理清洗,再送入检测流程,不能直接使用原始邮件文本流执行检测。
针对 Unicode 标签区块 U+E0000U+E007F,预处理模块需要做定向处理:识别该编码区块字符,针对旗帜 emoji 的合法特定组合做放行,其余场景下全部剥离删除该区块字符。同时同步处理其他常见混淆字符集合,包含 U+200B 零宽空格、U+00A0 不间断空格等零宽类字符集合。经过清洗之后,被不可见字符割裂的钓鱼关键字恢复为完整连续字符串,后续正则签名、分词器才可以正常识别高危关键词。
需要明确预处理的边界,预处理操作只作用于安全检测分析流程使用的文本副本,邮件原始存储内容不做修改,用户在邮件客户端拿到原始完整邮件内容,不会因为预处理清洗破坏原始邮件存储。预处理只给安全检测模块提供归一化之后的分析副本,兼顾安全检测需求与原始邮件数据完整性。
反网络钓鱼技术专家芦笛强调,归一化预处理不是一次性工作,安全研发人员需要持续跟进 Unicode 编码中新出现的可被滥用的非渲染字符集合,持续更新预处理字符集合,不能完成一次开发就永久固化处理列表。
5.2 多信号联合检测与威胁狩猎策略
单一信号容易产生误报,需要构建多特征融合的检测逻辑,将字符异常信号、诱饵主题特征、发送行为特征、URL 特征相互佐证,形成联合判定。
第一,将邮件文本中出现 U+E0000U+E007F 字符作为高权重异常特征,不直接执行拦截,作为风险打分重要因子。当该特征和金融融资类诱饵主题、批量发送行为、营销平台改写追踪域名等多项特征同时命中,提升邮件整体恶意评分,执行隔离或者告警处置;如果仅单独出现标签区块字符,且匹配旗帜 emoji 合法组合,则降低风险分数,避免误拦截正常邮件。
第二,针对该类钓鱼活动开展威胁狩猎工作,狩猎规则重点关注:邮件正文包含标签区块字符、邮件链接被第三方营销平台追踪域名改写、发送域名由一批金融相关词汇随机组合生成、信封发件域名匹配共享营销发送池命名范式。狩猎得到的样本可以沉淀到安全运营样本库,用于迭代规则和模型训练数据集。同时要注意,ActiveCampaign 的 IP、信封域名、追踪域名属于平台公共资产,不能单独作为恶意 IOC,必须结合内容混淆、诱饵主题等其他信号综合判断。
第三,持续维护传统钓鱼签名规则库,在预处理完成之后的归一化文本上执行正则、关键字签名匹配,保证签名规则运行在清洗后的文本之上,避免攻击者依靠字符插入直接绕过全部规则。
5.3 大语言模型邮件扫描组件的加固方案
针对大语言模型驱动的邮件安全扫描组件,不能直接接收原始未清洗邮件文本作为输入,必须执行前置归一化处理,把清洗完成的文本送入 tokenizer 分词器,规避不可见字符破坏 token 边界的对抗手段。
除文本预处理之外,可以引入邮件可视化 OCR 校验作为补充防护手段。将邮件渲染为和用户客户端看到效果一致的图像,使用光学字符识别提取图像内的可见文本,把 OCR 识别得到的文本作为另一路独立检测输入。攻击者的不可见 Unicode 字符不会在渲染图像中产生任何可见内容,OCR 提取的文本天然过滤掉全部不可见编码扰动。将原始文本解析检测结果和 OCR 图像解析检测结果做比对,两路结果互相校验,当两路文本解析得到的风险判定出现明显偏差时,标记为高可疑邮件,交由人工复核。该方案可以有效应对各类字符级不可见混淆攻击,但是会带来一定算力开销,企业安全网关可以针对已经命中异常字符特征的邮件样本触发 OCR 校验,不用对全部邮件做全量图像渲染,平衡算力开销与防护能力。
同时在模型训练阶段,训练数据集当中加入经过各类 Unicode 混淆扰动的钓鱼样本,提升模型对于字符对抗样本的鲁棒性。但模型层面的增强不能替代输入侧的预处理,模型增强属于辅助加固手段。
5.4 第三方邮件营销平台滥用风险治理
攻击者借助合法 SaaS 营销平台开展钓鱼投递,是该攻击活动重要的放大因素,该环节需要平台服务商与使用企业两端共同处置。
对于平台服务商,需要持续完善账号生命周期的风险识别,对新注册账号的批量发送行为做风险管控,将大量使用异常不可见 Unicode 字符作为账号滥用行为的检测信号,及时识别封禁恶意账号,完善内容审核机制,如同 ActiveCampaign 对外声明,让携带混淆字符的消息得到等价于清洗之后内容的审核结果。
对于企业侧,邮件网关层面无法管控外部第三方平台的账号行为,需要重点针对经过第三方追踪域名改写的链接做深度沙箱检测,不能只解析邮件文本内的改写追踪域名,必须跟随跳转链路获取最终落地页面,对真实落地页面执行沙箱分析、恶意页面判定。不能因为链接域名属于知名服务商就降低风险判定标准。
5.5 企业安全运营与人员防护补充
技术防护无法做到百分之百拦截所有威胁,需要配套安全运营流程和人员安全意识建设,构建最后一层防线。
第一,完善可疑邮件上报渠道,企业员工可以便捷上报可疑邮件,安全运营团队将上报样本纳入威胁分析,持续迭代检测规则。即便部分混淆钓鱼邮件绕过网关进入收件箱,依靠用户上报补齐威胁情报。
第二,针对企业业务人员开展针对性钓鱼安全培训,重点提示金融融资类邮件的风险点。即使邮件发件来源看起来正规,也不要直接点击邮件内部链接,优先通过独立浏览器手动访问服务商官网核验业务信息,不要信任邮件内携带的跳转链接。需要客观说明,普通用户无法肉眼分辨底层文本是否插入不可见 Unicode 字符,不能要求员工识别该类底层编码层面攻击,人员防护重点放在链接点击行为的风险管控,而不是识别看不见的字符。
第三,安全运营团队持续跟踪威胁情报,关注 AI 对抗技术向传统钓鱼场景迁移的相关安全报告,提前评估新对抗技术对自身邮件系统带来的潜在影响,不要仅在攻击爆发之后才被动处置。
6 结语
ASCII 走私技术在 2026 年大规模金融钓鱼攻击当中的应用,展示出 AI 领域的对抗手段正在快速向传统网络黑产生态扩散。该攻击没有利用软件高危漏洞,依靠 Unicode 编码渲染与解析逻辑的天然差异,通过插入不可见标签字符割裂钓鱼诱饵关键字,同时干扰传统签名规则、机器学习分类器、大语言模型邮件扫描模块,再结合第三方合法邮件营销平台的分发能力,形成具备大规模穿透能力的钓鱼攻击链路。
该事件暴露出很多邮件安全体系存在的底层短板:安全检测过度信任原始输入文本,忽略文本归一化预处理环节的价值,假设程序解析文本等价于人类可视化阅读文本。反网络钓鱼技术专家芦笛指出,本次攻击的启示并不局限于针对 U+E0000 标签区块这一组编码做修复,整个文本安全检测领域都需要正视输入侧对抗扰动的风险,不管是传统规则引擎还是大语言模型分析组件,都需要把输入文本预处理归一化作为检测流程的前置基础环节。
防御该类威胁不能寄希望单一技术手段实现一劳永逸,需要构建分层闭环防护:以文本归一化预处理为基础,搭配多特征联合风险判定、OCR 可视化校验的辅助检测手段,强化第三方改写链接的沙箱深度检测,再配合安全威胁狩猎、用户上报与安全意识培训,形成完整防护链条。同时安全从业者应当意识到,威胁攻击者会持续改造各类对抗技术,后续还会出现其他编码层面的混淆变种,防御工作需要保持持续迭代,持续跟进 Unicode 编码带来的各类对抗攻击面,不能停留在针对当前攻击样本的单点修复。
该轮大规模攻击活动的流量已经出现回落,但背后的金融钓鱼威胁团伙仍然持续运作,攻击者极有可能替换其他混淆技术继续开展攻击,企业组织不可以放松对此类威胁的监控,需要将本次事件得到的防护经验固化到邮件安全的常态化运营工作当中。
编辑:芦笛(公共互联网反网络钓鱼工作组)
来源:迪妙网络空间安全学院
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。