dongdonglog
AI Infra 系列 · 第五章 训练与调度(下):一万张 GPU 怎么排班,调度器才是训练场的隐形老板
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
dongdonglog
社区首页
>
专栏
>
AI Infra 系列 · 第五章 训练与调度(下):一万张 GPU 怎么排班,调度器才是训练场的隐形老板
AI Infra 系列 · 第五章 训练与调度(下):一万张 GPU 怎么排班,调度器才是训练场的隐形老板
dongdonglog
关注
发布于 2026-09-02 18:21:00
发布于 2026-09-02 18:21:00
31
0
举报
概述
单机调优解决"一台机器怎么跑得快",集群调度解决"一万台机器怎么不浪费"。训练集群的调度器每天面对的问题:有的作业要 512 张卡,有的只要 4 张;有的必须整组一起上,有的晚 5 分钟也无所谓;GPU 放错机柜,性能能差 3-8 倍。这篇讲清楚从设备插件到 DRA 的调度演进、Gang 调度、拓扑感知、SLURM 与 K8s 的分工,以及万卡集群怎么容错、怎么用 AI 来运营。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
kubernetes
nvidia
ruby on rails
GPU 云服务器
gpu
#Ai infra
#AI 推理
#AI 训练
#Volcano
#DRA
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档