首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >曙光8000首周满载:国产十万卡AI超集群,到底强在哪?

曙光8000首周满载:国产十万卡AI超集群,到底强在哪?

作者头像
码哥字节
发布2026-07-21 08:36:34
发布2026-07-21 08:36:34
310
举报
文章被收录于专栏:后端架构师后端架构师

你好,我是码哥。

写代码这么多年,我去展会最怕看「参数 PPT」。但今年 WAIC 不一样,镇馆之宝不是某个大模型,而是一台真机:中科曙光的曙光8000(登峰),国产十万卡 AI 超集群。

曙光8000 真机陈列专区

7 月 18 日,曙光在 WAIC 期间公布了一组运行数据,我看完第一反应是:这机器,真抢手。

首周就满载,峰值一天 50 万作业

曙光8000 正式上线首周即实现满载运行,目前日均处理作业数突破 15 万个,单日处理作业峰值超过 50 万个

截至现在,它已完成近千项超智融合应用适配,覆盖大模型训练、高通量推理、科学计算等多个万卡级规模场景。

作为天天跟性能和并发打交道的工程师,这个「满载」让我很感兴趣。十万卡规模的集群,满载意味着什么,是不是一排队就堵死?

答案反过来,满载不拥堵

满载不等于拥堵,这才是工程难点

很多人以为,集群规模上去,算力就线性增加。现实是,规模越大调度越难。十万卡一起跑,任务类型混杂,高精度科学计算和低精度训练推理全压在上面,调度稍有不当,就是大面积排队、资源空转。

曙光8000 的做法是三层动态资源管理:

  • 智能调度引擎:根据任务类型、数据位置、资源状态做智能分流;
  • 数据亲和性算法:让计算和存储尽量靠近,少跨节点搬数据;
  • 多元融合调度策略:同一套底座并行承载高精度仿真和智能计算。

官方说法是「高负载不拥堵、多任务不排队」。面对百万级用户并发,系统在高负载下仍保持畅通。

曙光8000 产品图

十万卡稳定运行的真正考验

十万卡规模稳定运行,考验的不是单卡性能,而是整个系统的协同。我挑几个工程师会关心的点。

第一,全球首创高密度机柜,算力密度高 20 倍。

单个计算单元算力密度,相比其他超节点提升 20 倍。有限空间塞进更高算力,靠的是超高速正交架构、全电互连、浸没相变液冷和高效供电这一整套系统工程技术。

第二,自研 scaleFabric 原生 RDMA 高速互连。

这是区别于传统大规模集群的核心网络优势。单子网支持 11.4 万卡规模,网卡端到端时延 小于 1 微秒,交换机转发时延 260 纳秒,单端口 800G;具备毫秒级链路故障自愈能力,网络稳定性不随集群规模扩张而衰减。无需光通讯即可实现万卡超高速稳定互连。

第三,IO500 双料第一的 ParaStor 存储。

配套 ParaStor 分布式存储,拿下 2026 年 IO500 榜单生产型全节点、10 节点两项全球性能第一。存储能力随集群节点扩容同步增长,保障数据吞吐与算力规模匹配。

第四,浸没式相变液冷,PUE 低至 1.04。

高功率密度集群的散热方案,全年自然冷却,PUE 低至 1.04,系统可用性高达 99.99%。

全链路国产,到底国产到什么程度

「全国产」三个字,这次是认真的。曙光8000 覆盖通用处理器、AI 加速芯片、互连交换芯片、整机、高速网络、调度软件全链条,搭载 6 款国产自研核心芯片,综合性能达国际先进水平。

更关键的是原生超智融合体系结构:同一套底座,既跑高精度科学工程计算(FP64、FP32),也跑低精度智能计算(BF16、FP8、INT8),完整支持 FP64、FP32、BF16、TF32、FP8、INT8 全精度。一套系统,两类差异化任务,不用为不同精度各建一套集群。

这种从架构设计之初就面向多元混合精度计算需求做原生优化的思路,对咱们做系统的人很有参考价值:算力堆叠容易,把异构任务揉进同一套底座还能稳定跑满,才是真功夫。

对开发者和科研,意味着什么

说到底,这种量级的基础设施,离普通开发者远吗?其实不远。

曙光8000 作为超算互联网核心节点,正在把高端算力变成可普惠使用的公共服务:

  • 超算互联网注册用户 140 万以上,月均访问 1130 万以上
  • 累计完成作业 2.4 亿个,日均 29 万以上;曙光8000 接入后,超算互联网日均处理作业突破 45 万以上
  • 适配 1600 余款开源大模型、600 余镜像、1000 余知识库17000 余个 Skills;
  • 通过连接全国 14 个省区市 30 余家超算智算中心,聚合形成 350 万以上 CPU 核心、25 万以上 GPU 加速卡的异构算力资源池。

平台还同步推出三大生态计划:十万卡共创者激励计划,面向高校、科创企业开放算力扶持;智能体生态共创与招募计划,支持开发行业科研智能体;核心生态伙伴招募计划,面向软硬件厂商开放全栈适配。开发者不用自建超大规模集群,就能按需调用优质算力。

曙光8000 产品图
曙光8000 产品图

曙光8000 产品图

写在最后

首周满载、近千项应用适配、高负载下稳定运行,这些数据说明一件事:超大规模 AI 基础设施的评价重点,正在从「系统规模」转向「实际服务能力」

对咱们写代码、做 AI 的人来说,国产算力从「能用」走到「好用、敢接真实任务」,曙光8000 算是交出了一份实打实的样本。

如果你也在做大模型训练、科学计算,或者想了解国产算力的落地路径,可以关注超算互联网和曙光8000 的后续进展。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-19,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 码哥跳动 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 首周就满载,峰值一天 50 万作业
  • 满载不等于拥堵,这才是工程难点
  • 十万卡稳定运行的真正考验
  • 全链路国产,到底国产到什么程度
  • 对开发者和科研,意味着什么
  • 写在最后
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档