大家跑大模型基本都用 NVIDIA,我们也一样身边不少人也都在用 RTX PRO 6000,甚至 H100B300 这类卡
看起来所有人的目光都盯着 NVIDIA但我们算过一笔账,单看原始算力,AMD 的 MI350X 其实是高于 NVIDIA B200 的那问题出在哪?
主要就是软件ROCm 不如 CUDA 成熟,整套软件栈也还落后一截
不过几周前我们拿到了几张 MI350X 做实验和开发,针对 Qwen3.6-35B-A3B 把 AMD 技术栈一路优化到了内核层,结果和 NVIDIA 那边的表现已经很接近了
我们测下来的数据是:
单张 MI350X:11161 output tok/s
8 张 MI350X:峰值 81331 output tok/s,平均 78498.66 output tok/s
在 8 卡测试里,这个吞吐量是 vLLM 的 2.16 倍
我们已经把内核等相关代码开源了,也写了博客讲背后的过程
但这事还没完我们有一个体会:一旦内核够快了,瓶颈就会转移到调度图覆盖循环状态路由,甚至 HTTP 序列化上