
在当前的大语言模型(LLM)时代,随着GPU集群规模的不断扩张,传统的网络架构逐渐暴露出短板,严重制约了算力的有效输出。
传统的云计算数据中心网络在面对AI训练任务时,显得力不从心。这主要体现在以下两个方面。
AI训练的网络流量具有周期性,且绝大多数为“大象流”(巨量数据流)。单条数据流能瞬间占满整个网卡带宽。在传统Clos架构中,经过多次转发后,这些大象流极易在ECMP机制下产生哈希极化。相同的五元组会导致流量严重堆叠,特别是在跨Pod场景中,会拖慢整个训练进程。
AI大模型的训练容错能力极低,通常要求所有GPU同步完成迭代。任何一个ToR(接入交换机)或Leaf节点发生故障,都会导致大面积的训练中断。
为解决上述问题,业界(如HPN架构)引入了双平面组网概念。相比传统的三层Clos架构,这种基于两层Spine-Leaf设计的创新架构降低了转发跳数与时延,其主要技术优势如下:
传统的MC-LAG堆叠方式需要设备间连接横穿线,这不仅浪费了AI智算网络端口带宽,还存在控制面与转发面不同步的隐患。双平面组网采用非堆叠的双ToR高可用设计,去除了横穿线,配合ARP双发与BGP主机路由收敛,通过上行的BGP协议宣告给整个平面。让服务器网卡能够无缝对接两台上行设备,彻底消除了ToR节点的单点故障。

如果依然采用传统的全互联网络,一张网卡分流出的数据在汇聚层依然会产生哈希极化。而在双平面解决方案中,网络被划分为两个完全没有物理链路互联的独立平面(如平面1和平面2)。流量从网卡发出后,被强制分流到不同的平面中转发,这种物理层面的隔离,从根本上根除了哈希极化现象。

在双平面架构下,原本需要单端口独占的400G网卡,可以拆分为两个200G端口,分别接入两个平面。这使得交换机的可用端口数量直接翻倍,甚至最高可支持16K至32K卡的大型集群。

尽管HPN架构 极大地优化了网络性能,但同时也高度依赖私有定制协议(如定制LACP并要求网卡支持ARP双发等),缺乏行业普适性。对于大多数用户而言,我们需要一套基于通用标准协议的双平面解决方案。
在AsterNOS等先进的开放网络操作系统中,LACP协议的实现不强制要求Port ID的严格一致性检查。这意味着,当网卡分出的两个端口分别对接到两个不同平面的交换机时,无需私有化定制协议,即可支持双上行链路聚合,直接打破了厂商锁定的壁垒。

针对部分主流网卡不支持ARP双发的痛点,两台同号Leaf交换机作为EVPN的PE设备,通过管理网或者交换机AUX 10G链路(非业务端口)直连建立BGP-EVPN协议连接,共同服务于同一组GPU服务器,服务器网卡发送ARP广播通过bond负载均衡之后发往其中一个平面的Leaf设备,Leaf设备通过向VXLAN隧道泛洪ARP广播使得隧道另一端的Leaf(不同平面)同步学习到了ARP,然后两台不同平面的Leaf将学习到的ARP表项转换为32位的主机路由(ARP-to-Host Route),通过上行的BGP协议宣告给整个平面。

传统ECMP逐流负载均衡极易引发AI智算网络的拥塞,影响训练。针对这一问题,介绍三种替代传统逐流负载分担的技术方案:
ARS(Adaptive Routing and Switching,自适应路由切换)是一种基于Flowlet(子流)的负载均衡技术。其借助ASIC提供的硬件ALB(Auto-Load-Balancing)([[1]])能力,能够在减少乱序的同时实现近乎逐包负载分担的均衡性。该技术通过将哈希值相同的数据流按一定时间间隔分割成一系列Flowlet,再通过实时感知端口的带宽利用率、队列深度等链路质量指标,将Flowlet主动分配至空闲路径,从而提升整体网络带宽利用率。
动态智能选路是一种基于感知路由的负载均衡技术,综合评估带宽使用、队列占用、转发时延等关键参数,精准判断网络路径质量。其中,带宽和队列使用基于ASIC硬件寄存器统计,精度达百毫秒级;转发时延基于INT(In-band Network Telemetry,带内网络遥测)技术,精度达纳秒级。各交换机实时检测路径质量,通过BGP扩展属性传递信息,并结合逐流的动态WCMP(Weighted Cost Multipath,加权多路径),将流量动态分配至最佳路径,避免网络瓶颈,提升带宽利用率。
包喷洒是一种逐包负载均衡技术,通过将数据包均匀喷洒到各条链路上,避免单一路径拥堵。包喷洒技术包含两种算法:

上图为一个256计算节点(2048个GPU)的400G AI智算双平面Rail-optimized架构组网图,部署48台CX864E-N(16台Spine节点,32台Leaf节点),包含两个平面,每个平面16台Leaf节点和8台Spine节点。其核心设计原则如下:
双平面解决方案只是网络革新的起点。随着GPU算力的飙升(如800G乃至更高带宽网卡的普及),会不约而同的向多平面网络演进。
在AI算力竞速的下半场,构建高可靠、高吞吐、低延迟的多平面网络,将是每个智算中心不可或缺的核心竞争力。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。