首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >双平面组网方案:破解AI智算中心网络瓶颈的普适性架构

双平面组网方案:破解AI智算中心网络瓶颈的普适性架构

原创
作者头像
星融元Asterfusion
发布2026-07-27 14:55:33
发布2026-07-27 14:55:33
1070
举报
文章被收录于专栏:智能网关智能网关

在当前的大语言模型(LLM)时代,随着GPU集群规模的不断扩张,传统的网络架构逐渐暴露出短板,严重制约了算力的有效输出。

AI计算网络面临的困境

传统的云计算数据中心网络在面对AI训练任务时,显得力不从心。这主要体现在以下两个方面。

大象流引发的哈希极化与负载失衡

AI训练的网络流量具有周期性,且绝大多数为“大象流”(巨量数据流)。单条数据流能瞬间占满整个网卡带宽。在传统Clos架构中,经过多次转发后,这些大象流极易在ECMP机制下产生哈希极化。相同的五元组会导致流量严重堆叠,特别是在跨Pod场景中,会拖慢整个训练进程。

单点故障代价高昂,训练中断频发

AI大模型的训练容错能力极低,通常要求所有GPU同步完成迭代。任何一个ToR(接入交换机)或Leaf节点发生故障,都会导致大面积的训练中断。

双平面解决方案的核心设计

为解决上述问题,业界(如HPN架构)引入了双平面组网概念。相比传统的三层Clos架构,这种基于两层Spine-Leaf设计的创新架构降低了转发跳数与时延,其主要技术优势如下:

非堆叠双ToR接入,消除单点故障

传统的MC-LAG堆叠方式需要设备间连接横穿线,这不仅浪费了AI智算网络端口带宽,还存在控制面与转发面不同步的隐患。双平面组网采用非堆叠的双ToR高可用设计,去除了横穿线,配合ARP双发与BGP主机路由收敛,通过上行的BGP协议宣告给整个平面。让服务器网卡能够无缝对接两台上行设备,彻底消除了ToR节点的单点故障。

非堆叠方案高可用机制
非堆叠方案高可用机制

物理彻底隔离,从根源解决哈希极化

如果依然采用传统的全互联网络,一张网卡分流出的数据在汇聚层依然会产生哈希极化。而在双平面解决方案中,网络被划分为两个完全没有物理链路互联的独立平面(如平面1和平面2)。流量从网卡发出后,被强制分流到不同的平面中转发,这种物理层面的隔离,从根本上根除了哈希极化现象。

物理隔离消除极化
物理隔离消除极化

端口拆分技术,实现GPU集群规模翻倍

在双平面架构下,原本需要单端口独占的400G网卡,可以拆分为两个200G端口,分别接入两个平面。这使得交换机的可用端口数量直接翻倍,甚至最高可支持16K至32K卡的大型集群。

双平面设计
双平面设计

打造具普适性的AI双平面网络

尽管HPN架构 极大地优化了网络性能,但同时也高度依赖私有定制协议(如定制LACP并要求网卡支持ARP双发等),缺乏行业普适性。对于大多数用户而言,我们需要一套基于通用标准协议的双平面解决方案。

绕过定制化LACP,实现双上行聚合

在AsterNOS等先进的开放网络操作系统中,LACP协议的实现不强制要求Port ID的严格一致性检查。这意味着,当网卡分出的两个端口分别对接到两个不同平面的交换机时,无需私有化定制协议,即可支持双上行链路聚合,直接打破了厂商锁定的壁垒。

无需定制化LACP
无需定制化LACP

解决ARP双发限制 (EVPN Multihoming)

针对部分主流网卡不支持ARP双发的痛点,两台同号Leaf交换机作为EVPN的PE设备,通过管理网或者交换机AUX 10G链路(非业务端口)直连建立BGP-EVPN协议连接,共同服务于同一组GPU服务器,服务器网卡发送ARP广播通过bond负载均衡之后发往其中一个平面的Leaf设备,Leaf设备通过向VXLAN隧道泛洪ARP广播使得隧道另一端的Leaf(不同平面)同步学习到了ARP,然后两台不同平面的Leaf将学习到的ARP表项转换为32位的主机路由(ARP-to-Host Route),通过上行的BGP协议宣告给整个平面。

智能选路与自适应负载均衡

传统ECMP逐流负载均衡极易引发AI智算网络的拥塞,影响训练。针对这一问题,介绍三种替代传统逐流负载分担的技术方案:

  • 自适应路由切换

ARS(Adaptive Routing and Switching,自适应路由切换)是一种基于Flowlet(子流)的负载均衡技术。其借助ASIC提供的硬件ALB(Auto-Load-Balancing)([[1]])能力,能够在减少乱序的同时实现近乎逐包负载分担的均衡性。该技术通过将哈希值相同的数据流按一定时间间隔分割成一系列Flowlet,再通过实时感知端口的带宽利用率、队列深度等链路质量指标,将Flowlet主动分配至空闲路径,从而提升整体网络带宽利用率。

  • 智能选路(动态智能选路)

动态智能选路是一种基于感知路由的负载均衡技术,综合评估带宽使用、队列占用、转发时延等关键参数,精准判断网络路径质量。其中,带宽和队列使用基于ASIC硬件寄存器统计,精度达百毫秒级;转发时延基于INT(In-band Network Telemetry,带内网络遥测)技术,精度达纳秒级。各交换机实时检测路径质量,通过BGP扩展属性传递信息,并结合逐流的动态WCMP(Weighted Cost Multipath,加权多路径),将流量动态分配至最佳路径,避免网络瓶颈,提升带宽利用率。

  • 包喷洒

包喷洒是一种逐包负载均衡技术,通过将数据包均匀喷洒到各条链路上,避免单一路径拥堵。包喷洒技术包含两种算法:

  1. Random算法:将数据包随机分散至各条链路;
  2. Round Robin算法:按顺序将数据包逐一、等量地分散至各条链路。

集群组网设计

中大规模400G AI智算双平面网络组网
中大规模400G AI智算双平面网络组网

上图为一个256计算节点(2048个GPU)的400G AI智算双平面Rail-optimized架构组网图,部署48台CX864E-N(16台Spine节点,32台Leaf节点),包含两个平面,每个平面16台Leaf节点和8台Spine节点。其核心设计原则如下:

  • 每个GPU连接专用400G网卡,每个400G网卡出两个端口分别连接两个平面,每台服务器的网卡所出的第一个端口按照“NIC1-Leaf1、NIC2-Leaf2……”的规则接入Plane 1的Leaf交换机,每台服务器的网卡所出的第二个端口按照“NIC1-Leaf1、NIC2-Leaf2……”的规则接入Plane 2的Leaf交换机。
  • 每个平面网络采用2层Clos架构,平面内Spine与Leaf全互联,利用IPv6 link-local特性建立unnumbered BGP邻居,宣告各Rail的网段路由,实现路由交换,无需为Leaf-Spine互联接口规划IP地址;
  • Leaf下行与上行容量的比值应严格遵循1:1收敛比,保证无阻塞传输;
  • Leaf、Spine交换机启用一键RoCE及负载均衡特性,构建无损网络。

从双平面到多平面:AI智算网络的未来展望

双平面解决方案只是网络革新的起点。随着GPU算力的飙升(如800G乃至更高带宽网卡的普及),会不约而同的向多平面网络演进。

AI算力竞速的下半场,构建高可靠、高吞吐、低延迟的多平面网络,将是每个智算中心不可或缺的核心竞争力。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • AI计算网络面临的困境
    • 大象流引发的哈希极化与负载失衡
    • 单点故障代价高昂,训练中断频发
  • 双平面解决方案的核心设计
    • 非堆叠双ToR接入,消除单点故障
    • 物理彻底隔离,从根源解决哈希极化
    • 端口拆分技术,实现GPU集群规模翻倍
  • 打造具普适性的AI双平面网络
    • 绕过定制化LACP,实现双上行聚合
    • 解决ARP双发限制 (EVPN Multihoming)
  • 智能选路与自适应负载均衡
  • 集群组网设计
  • 从双平面到多平面:AI智算网络的未来展望
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档