首页
学习
活动
专区
圈层
工具
发布

Qwen3.6-35B-A3B 在 AMD MI350X 上开源内核优化:8 卡输出达 78498 tok/s

大家跑大模型基本都用 NVIDIA,我们也一样身边不少人也都在用 RTX PRO 6000,甚至 H100B300 这类卡

看起来所有人的目光都盯着 NVIDIA但我们算过一笔账,单看原始算力,AMD 的 MI350X 其实是高于 NVIDIA B200 的那问题出在哪?

主要就是软件ROCm 不如 CUDA 成熟,整套软件栈也还落后一截

不过几周前我们拿到了几张 MI350X 做实验和开发,针对 Qwen3.6-35B-A3B 把 AMD 技术栈一路优化到了内核层,结果和 NVIDIA 那边的表现已经很接近了

我们测下来的数据是:

单张 MI350X:11161 output tok/s

8 张 MI350X:峰值 81331 output tok/s,平均 78498.66 output tok/s

在 8 卡测试里,这个吞吐量是 vLLM 的 2.16 倍

我们已经把内核等相关代码开源了,也写了博客讲背后的过程

但这事还没完我们有一个体会:一旦内核够快了,瓶颈就会转移到调度图覆盖循环状态路由,甚至 HTTP 序列化上

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OD_BjzzOcSdcRLTefYZYkBEg0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券