dongdonglog
AI Infra 系列 · 第四章 训练与调度(上): 8 张卡 7 张闲?单机调优才是你欠下的第一笔账
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
dongdonglog
社区首页
>
专栏
>
AI Infra 系列 · 第四章 训练与调度(上): 8 张卡 7 张闲?单机调优才是你欠下的第一笔账
AI Infra 系列 · 第四章 训练与调度(上): 8 张卡 7 张闲?单机调优才是你欠下的第一笔账
dongdonglog
关注
修改于 2026-09-01 11:37:34
修改于 2026-09-01 11:37:34
29
0
举报
概述
这一篇把镜头拉回一台机器内部:为什么 8 张卡里总有一张利用率上不去?为什么同样的代码,换个机器慢 20%?答案往往不在算法,而在 CPU 怎么给 GPU 喂数据。NUMA、CPU 绑定、内存固定、THP、GPU 持久化、MPS/MIG、容器挂载——七个旋钮,每个都能榨出几个点的吞吐。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
ruby on rails
服务器配置
算法
GPU 云服务器
机器学习
#AI infra
# AI 训练
#GPU
#推理调度
#nvidia
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档