首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI Infra 系列 · 第五章 训练与调度(下):一万张 GPU 怎么排班,调度器才是训练场的隐形老板

AI Infra 系列 · 第五章 训练与调度(下):一万张 GPU 怎么排班,调度器才是训练场的隐形老板

作者头像
dongdonglog
发布2026-09-02 18:21:00
发布2026-09-02 18:21:00
310
举报
概述
单机调优解决"一台机器怎么跑得快",集群调度解决"一万台机器怎么不浪费"。训练集群的调度器每天面对的问题:有的作业要 512 张卡,有的只要 4 张;有的必须整组一起上,有的晚 5 分钟也无所谓;GPU 放错机柜,性能能差 3-8 倍。这篇讲清楚从设备插件到 DRA 的调度演进、Gang 调度、拓扑感知、SLURM 与 K8s 的分工,以及万卡集群怎么容错、怎么用 AI 来运营。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档