首页
学习
活动
专区
圈层
工具
发布
首页标签GPU 云服务器

#GPU 云服务器

极致并行计算能力,专业计算加速服务

AI Infra 系列 · 第五章 训练与调度(下):一万张 GPU 怎么排班,调度器才是训练场的隐形老板

dongdonglog

如果你管过一个训练集群,下面这个场景一定不陌生:周三下午,三个团队同时提交作业——A 要 512 卡训大模型,B 要 64 卡微调,C 只要 8 卡跑实验。调度...

4520

AI Infra 系列 · 第五章 训练与调度(上): 8 张卡 7 张闲?单机调优才是你欠下的第一笔账

dongdonglog

先讲个真实的烦恼。你组里一个训练任务,跑了三天,nvidia-smi 一查:GPU 利用率 60%,还一跳一跳的,像打摆子。算法同学说"代码没问题",网络同学说...

18620

8卡L20使用 --gpu-memory-utilization 0.5 提前为 MiniMax-H3 腾出显存

高老师

腾讯云TDP | 先锋会员 (已认证)

在拥有 8 张 L20(单卡 48GB 显存)的服务器上,我们往往面临着“算力充裕但显存碎片化”的尴尬。为了未来能够顺利运行 MiniMax-H3 这样的大参数...

24610

云托管平台滥用下银行仿冒钓鱼站点治理研究 —— 基于印度 I4C 要求谷歌处置钓鱼站点事件的实证分析

芦笛

中国互联网络信息中心 | 工程师 (已认证)

数字金融普及推动银行业务全面向线上迁移,网络钓鱼已经成为金融领域财产侵害的主要威胁,攻击者不断转向主流云开发托管平台搭建仿冒银行网页与伪应用,依托云平台的可信基...

15410

复现 GitHub 深度学习项目,先别急着装依赖

论文复现现场

从 GitHub 拉一个深度学习项目下来,最容易踩的坑不是代码看不懂,而是环境看起来都对,跑起来却总差一点。

12210

企业GPU监控实战:从手动排查到统一算力运维

运维行者

随着人工智能、大模型训练、视频渲染和高性能计算(HPC)的快速发展,GPU 已逐渐成为企业 IT 基础设施中最重要的计算资源之一。从 AI 模型训练到数据分析,...

19110
领券