首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >华为超节点是什么?上海 WAIC 看完,我终于搞懂了

华为超节点是什么?上海 WAIC 看完,我终于搞懂了

作者头像
不吃草的牛德
发布2026-07-21 09:16:11
发布2026-07-21 09:16:11
370
举报
文章被收录于专栏:RustRust

7 月 17 日,2026 世界人工智能大会(WAIC)在上海开幕。 华为展台上,一台由 16 个计算柜、1024 张 AI 芯片组成的"铁柜阵"第一次公开亮相。 同一天,华为还甩出一个更炸的数字:上一代超节点,已经商用落地 750 多套。 很多人看完一脸懵:超节点,到底是个啥?


01 先给个一句话定义

超节点,就是把几百甚至上千张 AI 加速芯片,用超高带宽的总线连成一个"逻辑上统一的大芯片"。

注意关键词:不是把一堆服务器用网线攒起来(那是传统集群),而是让几百张卡之间像在同一块主板上一样,能高频、低延迟地互相访问彼此的算力和内存。

你可以把它理解成:传统集群是一群人各干各的、靠微信沟通;超节点是把这群人塞进同一个房间、面对面喊话。

差距,就在"沟通效率"上。


02 为什么突然需要超节点

要理解超节点为什么火,得先看大模型把算力逼到了什么境地。

现在的趋势很清楚:

  • 模型越来越大:DeepSeek-R1 这种 MoE 模型,参数上千亿,单张卡根本装不下
  • 上下文越来越长:百万 Token 的长上下文,KV Cache 能把显存撑爆
  • 智能体(Agent)要求低时延:推理要快,用户才不转圈

传统集群的死穴就在这:卡和卡之间的通信,成了比算力更大的瓶颈。

当一张卡算完自己那部分,要把中间结果传给下一张卡——这个"传"的动作,在传统网络下要过交换机、走协议栈,延迟高、带宽有限。模型一大,大量时间花在"等数据"上,芯片算力再强也闲着。

SemiAnalysis 有句评价很到位:华为单芯片性能大概只有英伟达 Blackwell 的三分之一,但通过系统级架构创新,整体算力反而领先了。

这就是超节点存在的根本理由:单芯片打不过,就用系统赢。


03 华为的"灵衢"总线,牛在哪

华为超节点的核心技术,叫灵衢(UB,Unified Bus)互联协议

它干的事,是把 384 颗昇腾 910C 和 192 颗鲲鹏 CPU,通过一层无阻塞的全对等互联网络,焊成一个统一整体。几个数字感受一下:

  • • 单芯片跨节点带宽 392 GB/s —— 跨节点通信效率损耗不到 3%
  • • 系统级互联带宽 269 TB/s(双向)
  • • 机柜形态:12 个计算柜 + 4 个通信柜,共 16 柜
  • • 整机算力约 300 PFLOPs(BF16)

392 GB/s 是什么概念?对比一下:普通人家的 NVMe 固态硬盘,顺序读写也就几 GB/s。这里每一张 AI 芯片,对外"喊话"的通道就是 392 GB/s 级别。

更关键的是统一内存编址。CPU 的内存、NPU 的显存、甚至 SSD,通过 UB 网络池化成一块统一的大内存。模型要读 KV Cache,不用在卡之间搬来搬去,直接按地址访问,访问延迟降了 86%

这一点对长上下文推理是质变——百万 Token 的 KV Cache 不再卡脖子。


04 950:把规模再翻一个数量级

这次 WAIC 亮相的昇腾 950,是 384 的接棒者。

  • • 以单柜 64 卡为基本单元,现场版本 16 柜共 1024 张 NPU 高速互联
  • • 提供 1 EFLOPS FP8 / 2 EFLOPS FP4 算力
  • 256 TB 全局统一内存编址
  • • TB 级 NPU 互联带宽,3 微秒 RTT 时延
  • • 最大可支持 8192 张卡互联;基于 950 的 SuperCluster 集群可扩展到 50 万卡

一句话:384 证明了"超节点路线可行",950 的任务是证明"这条路能大规模商用"。


05 真正炸的,不是参数,是 750 套

参数再漂亮,也可能是 PPT。

华为同一天披露的那条消息,比任何跑分都重要:昇腾 384 超节点,已经商用落地 750 多套。

这个数字意味着什么?

它标志着国产 AI 算力,从"技术验证 / 示范项目"阶段,迈进了规模化行业落地阶段。

而且覆盖的是实打实的行业:互联网、运营商、金融、教育、医疗、交通、制造,20 多个行业,60 多种真实业务场景。粤港澳大湾区那个"国芯训国模"万卡智算集群,规划部署 30 套 384 超节点。

华为还放话说,384 是国内唯一规模商用的超节点,也是国内唯一训练出 SOTA 模型的超节点。

从"能不能用",到"用了多少"——这个拐点的信号很明确:AI 算力的竞争逻辑,已经从单芯片性能比拼,切换到了系统级集群能力竞争。


06 软件也不能少:CANN

硬件再猛,没有软件生态也是空壳。

华为对应 CUDA 的那套,叫 CANN(神经网络计算架构)。它把 PyTorch、TensorFlow 的计算图翻译成昇腾 NPU 能执行的指令,相当于华为版的"CUDA 运行时"。

2025 年 CANN 已经全面开源:社区累计上线 67 个项目,开源代码超 1244 万行,月活开发者突破 3500 人

这个数字和英伟达几百万 CUDA 开发者比还小,但方向是对的——生态不是一天建起来的,但得先开源、先让人用起来。


07 对做 AI 应用的人,意味着什么

超节点这种"系统级算力"成熟,最直接的受益者是所有要跑大模型的应用方——包括金融、量化这类对算力和时延都敏感的行业(华为披露 384 已落地金融场景)。

几个实在的变化:

算力供给变多、变便宜。 国产超节点规模商用,意味着被制裁卡脖子的窗口在收窄,算力"即开即用"的"水电模式"在铺开。对中小团队,训练/推理成本会往下走。

长上下文、低时延推理成为可能。 统一内存 + 高带宽,让百万 Token 上下文、高并发 Agent 推理不再卡。做 AI 投研、智能客服、实时决策的团队,能玩的东西更多了。

朝推夜训提利用率。 华为的"朝推夜训"模式(白天推理、晚上训练),把算力利用率再提 30%+。对成本敏感的金融业务,这笔账很划算。

简单说:底层算力底座越扎实,上层的 AI 应用越敢想敢做。


08 但也别上头:冷静看三面

写技术文章,不能只吹。三句话泼点冷水:

第一,单芯片仍落后。 灵衢总线再强,底下那颗昇腾 910C 的单卡性能,和英伟达最新代差还在。超节点是用"系统"补"单点",不是单点已经反超。

第二,生态差距是长期的。 CUDA 积累十几年,开发者、库、工具链是护城河。CANN 开源是好的开始,但追赶需要时间,也需要更多真实项目打磨。

第三,供应链仍是变量。 先进制程、HBM 这些底层,外部环境并不稳定。750 套是成绩,但规模再上一个数量级,考验的是整条供应链。


09 写在最后

回头看这次 WAIC,超节点成了全行业共同的技术方向——百度、阿里、中兴、曙光都亮出了自己的超节点方案。

这说明一件事:大模型竞争的胜负手,已经不在某一颗芯片上,而在谁能把成千上万颗芯片,高效组织成一个"大脑"。

华为用 750 套落地证明:这条路,走得通。

摩尔定律逼近极限的今天,决胜的关键,是整个系统的"神经网络"效率。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-19,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 Rust火箭工坊 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 01 先给个一句话定义
  • 02 为什么突然需要超节点
  • 03 华为的"灵衢"总线,牛在哪
  • 04 950:把规模再翻一个数量级
  • 05 真正炸的,不是参数,是 750 套
  • 06 软件也不能少:CANN
  • 07 对做 AI 应用的人,意味着什么
  • 08 但也别上头:冷静看三面
  • 09 写在最后
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档