7 月 17 日,2026 世界人工智能大会(WAIC)在上海开幕。 华为展台上,一台由 16 个计算柜、1024 张 AI 芯片组成的"铁柜阵"第一次公开亮相。 同一天,华为还甩出一个更炸的数字:上一代超节点,已经商用落地 750 多套。 很多人看完一脸懵:超节点,到底是个啥?
超节点,就是把几百甚至上千张 AI 加速芯片,用超高带宽的总线连成一个"逻辑上统一的大芯片"。
注意关键词:不是把一堆服务器用网线攒起来(那是传统集群),而是让几百张卡之间像在同一块主板上一样,能高频、低延迟地互相访问彼此的算力和内存。
你可以把它理解成:传统集群是一群人各干各的、靠微信沟通;超节点是把这群人塞进同一个房间、面对面喊话。
差距,就在"沟通效率"上。
要理解超节点为什么火,得先看大模型把算力逼到了什么境地。
现在的趋势很清楚:
传统集群的死穴就在这:卡和卡之间的通信,成了比算力更大的瓶颈。
当一张卡算完自己那部分,要把中间结果传给下一张卡——这个"传"的动作,在传统网络下要过交换机、走协议栈,延迟高、带宽有限。模型一大,大量时间花在"等数据"上,芯片算力再强也闲着。
SemiAnalysis 有句评价很到位:华为单芯片性能大概只有英伟达 Blackwell 的三分之一,但通过系统级架构创新,整体算力反而领先了。
这就是超节点存在的根本理由:单芯片打不过,就用系统赢。
华为超节点的核心技术,叫灵衢(UB,Unified Bus)互联协议。
它干的事,是把 384 颗昇腾 910C 和 192 颗鲲鹏 CPU,通过一层无阻塞的全对等互联网络,焊成一个统一整体。几个数字感受一下:
392 GB/s 是什么概念?对比一下:普通人家的 NVMe 固态硬盘,顺序读写也就几 GB/s。这里每一张 AI 芯片,对外"喊话"的通道就是 392 GB/s 级别。
更关键的是统一内存编址。CPU 的内存、NPU 的显存、甚至 SSD,通过 UB 网络池化成一块统一的大内存。模型要读 KV Cache,不用在卡之间搬来搬去,直接按地址访问,访问延迟降了 86%。
这一点对长上下文推理是质变——百万 Token 的 KV Cache 不再卡脖子。
这次 WAIC 亮相的昇腾 950,是 384 的接棒者。
一句话:384 证明了"超节点路线可行",950 的任务是证明"这条路能大规模商用"。
参数再漂亮,也可能是 PPT。
华为同一天披露的那条消息,比任何跑分都重要:昇腾 384 超节点,已经商用落地 750 多套。
这个数字意味着什么?
它标志着国产 AI 算力,从"技术验证 / 示范项目"阶段,迈进了规模化行业落地阶段。
而且覆盖的是实打实的行业:互联网、运营商、金融、教育、医疗、交通、制造,20 多个行业,60 多种真实业务场景。粤港澳大湾区那个"国芯训国模"万卡智算集群,规划部署 30 套 384 超节点。
华为还放话说,384 是国内唯一规模商用的超节点,也是国内唯一训练出 SOTA 模型的超节点。
从"能不能用",到"用了多少"——这个拐点的信号很明确:AI 算力的竞争逻辑,已经从单芯片性能比拼,切换到了系统级集群能力竞争。
硬件再猛,没有软件生态也是空壳。
华为对应 CUDA 的那套,叫 CANN(神经网络计算架构)。它把 PyTorch、TensorFlow 的计算图翻译成昇腾 NPU 能执行的指令,相当于华为版的"CUDA 运行时"。
2025 年 CANN 已经全面开源:社区累计上线 67 个项目,开源代码超 1244 万行,月活开发者突破 3500 人。
这个数字和英伟达几百万 CUDA 开发者比还小,但方向是对的——生态不是一天建起来的,但得先开源、先让人用起来。
超节点这种"系统级算力"成熟,最直接的受益者是所有要跑大模型的应用方——包括金融、量化这类对算力和时延都敏感的行业(华为披露 384 已落地金融场景)。
几个实在的变化:
算力供给变多、变便宜。 国产超节点规模商用,意味着被制裁卡脖子的窗口在收窄,算力"即开即用"的"水电模式"在铺开。对中小团队,训练/推理成本会往下走。
长上下文、低时延推理成为可能。 统一内存 + 高带宽,让百万 Token 上下文、高并发 Agent 推理不再卡。做 AI 投研、智能客服、实时决策的团队,能玩的东西更多了。
朝推夜训提利用率。 华为的"朝推夜训"模式(白天推理、晚上训练),把算力利用率再提 30%+。对成本敏感的金融业务,这笔账很划算。
简单说:底层算力底座越扎实,上层的 AI 应用越敢想敢做。
写技术文章,不能只吹。三句话泼点冷水:
第一,单芯片仍落后。 灵衢总线再强,底下那颗昇腾 910C 的单卡性能,和英伟达最新代差还在。超节点是用"系统"补"单点",不是单点已经反超。
第二,生态差距是长期的。 CUDA 积累十几年,开发者、库、工具链是护城河。CANN 开源是好的开始,但追赶需要时间,也需要更多真实项目打磨。
第三,供应链仍是变量。 先进制程、HBM 这些底层,外部环境并不稳定。750 套是成绩,但规模再上一个数量级,考验的是整条供应链。
回头看这次 WAIC,超节点成了全行业共同的技术方向——百度、阿里、中兴、曙光都亮出了自己的超节点方案。
这说明一件事:大模型竞争的胜负手,已经不在某一颗芯片上,而在谁能把成千上万颗芯片,高效组织成一个"大脑"。
华为用 750 套落地证明:这条路,走得通。
摩尔定律逼近极限的今天,决胜的关键,是整个系统的"神经网络"效率。