
全文概览
当大语言模型从单轮问答走向长文本分析、检索增强生成(RAG)和多轮智能体(Agentic AI)工作流,推理系统的瓶颈已悄然转移——算力不再是唯一的约束,内存容量与传输带宽正在成为新的木桶短板。
在 Transformer 推理过程中,系统需要缓存 Key 和 Value 张量(即 KV Cache)以避免重复计算。然而在数十万 Token 的长上下文场景下,KV Cache 的体积可迅速膨胀至数百 GB 甚至 TB 级别,远超单卡 GPU HBM 的承载极限。传统的缓存逐出策略会触发频繁重计算,推高首字延迟、拖垮吞吐量。当 GPU 显存"装不下"推理上下文时,数据该流向哪里?谁又来负责这场计算与存储之间的高速搬运?
这正是数据处理单元(DPU)从传统网络加速器蜕变为"推理上下文加速引擎"的背景。本文以 AMD Pensando Salina 与 NVIDIA BlueField-4 两款下一代 DPU 为切入点,拆解 KV Cache 卸载的技术机制、硬件架构差异与智算基础设施的选型逻辑——一场围绕"内存墙"的架构重构正在发生,而 DPU 站到了舞台中央。
阅读收获
👉 划线高亮 观点批注

随着生成式人工智能从单轮问答向长文本分析、检索增强生成(RAG)以及多轮智能体(Agentic AI)工作流演进,大语言模型(LLM)推理系统的瓶颈已从单纯的算力约束转向内存容量与传输带宽约束1。在 Transformer 架构的推理过程中,为了避免在生成新 Token 时重复计算历史序列的注意力状态,系统会保存 Key 和 Value 张量,即 KV Cache3。KV Cache 的内存占用量与模型层数、注意力头数、隐藏层维度以及上下文序列长度和并发 Batch Size 成正比,其规模估算关系如下:
各变量含义:
变量 | 含义 |
|---|---|
KV 缓存的总大小(字节) | |
固定系数,因为缓存同时存储 K(Key) 和 V(Value) 两个矩阵 | |
模型的 Transformer 层数 | |
每层的注意力头数 | |
每个注意力头的维度大小 | |
数值精度对应的字节数(如 FP16 = 2 字节,FP32 = 4 字节) | |
推理时的批次大小 | |
输入序列的长度(token 数) |
直观理解:每一层、每个头、每个 token 位置都需要存一份 Key 和 Value,所以总大小就是把这些维度全部乘起来再乘以精度字节数。这也是为什么长序列推理(如 128K context)时 KV 缓存会成为显存瓶颈—— 线性增长直接放大整体开销。
在动辄数十万 Token 的长上下文或高并发智能体交互场景下,KV Cache 的体积可迅速达到数百 GB 甚至 TB 级别,远超 GPU 高带宽内存(HBM)的承载极限1。传统的缓存逐出(Eviction)策略会导致频繁的重新计算,大幅推高首字延迟(Time to First Token, TTFT)并降低吞吐量1。为了突破这一“内存墙”,将 KV Cache 从 GPU HBM 动态卸载至主机 DRAM、本地 NVMe SSD 或远端共享存储池,成为当前推理基础设施的核心优化手段4。
在此背景下,分片预填与解码分离(Disaggregated Prefill and Decode)架构应运而生4。Prefill 阶段属于计算密集型,而 Decode 阶段属于内存带宽密集型,两者的解耦要求 KV Cache 张量能够以极低的延迟和极高的吞吐在不同节点间快速迁移7。然而,若依赖传统的 CPU 进行数据搬运与协议栈处理,不仅会占用大量 Host CPU 核心,还会因 CPU 中断与内存拷贝引发显著的数据抖动4。
数据处理器(DPU)的功能定位因此发生了深刻的范式转移:DPU 已不再局限于传统数据中心中简单的网络协议加速(如 Open vSwitch)、虚拟化和基础安全卸载,而是直接植入大模型推理的数据通路,演变为具备高并发数据编排、调度感知(Scheduler-Aware)和硬件级零拷贝传输功能的“推理上下文加速引擎”2。
多级上下文存储层级与 DPU 编排关系如下:
作为领军芯片厂商针对 AI 基础设施推出的下一代 DPU,AMD Pensando Salina(第三代 Pensando DPU)与 NVIDIA BlueField-4 代表了两种截然不同但又互为借鉴的硬件设计哲学与集成路径9。

AMD Pensando Salina DPU 继承了 Pensando 架构以“可编程数据平面引擎”为核心的基因14。Salina 的核心处理单元由 232 个可编程 P4 微流水线处理器(MPU)和 16 个 Arm Neoverse N1 通用核心组成14。P4 MPU 专门负责线速的数据包处理、灵活封包/解包(如 VXLAN、Geneve)以及硬件级的数据压缩与加解密16。Salina 搭载单口 400GbE 网络接口(双 QSFP112 物理接口),通过 PCIe Gen5 x16 主机接口连接主机 CPU/GPU14。在系统集成定位上,Salina 被定义为 AI 智算集群的前向网络(Front-End Network)核心网关,重点解决南北向数据摄入、多租户安全隔离、存储解耦以及上下文数据在计算卡与前向存储间的调度传输3。


相比之下,NVIDIA BlueField-4 则展现了向“芯片级高性能计算节点”演进的路线12。BlueField-4 集成了包含 64 个 Arm Neoverse V2 核心的 Grace CPU,晶体管数量暴增至 640 亿个(是上一代 BlueField-3 的 3 倍以上),算力提升达 6 倍12。在网络方面,它融合了最新的 ConnectX-9 SuperNIC,提供高达 800 Gbps 的单卡网络吞吐量,并全面支持 PCIe Gen6 接口12。此外,BlueField-4 板载 128GB LPDDR5 内存和 512GB 的板载 SSD12。在 NVIDIA Vera Rubin 平台中,BlueField-4 不再仅仅扮演网卡或网关的角色,而是作为独立运行 DOCA 微服务、CMX 上下文存储引擎以及分布式数据平面的核心处理器,深度融入 Pod 级与机架级的以太网网格架构中2。

对比维度 | AMD Pensando Salina DPU | NVIDIA BlueField-4 DPU |
|---|---|---|
网络吞吐带宽 | 400 Gbps(支持 2x400GE 端口配置,受 PCIe Gen5 限制单个主机驱动 400G)14 | 800 Gbps(集成 ConnectX-9 SuperNIC)12 |
主机物理接口 | PCIe Gen5.0 x1614 | PCIe Gen6.0 x1612 |
通用算力核心 | 16-Core Arm Neoverse N114 | 64-Core Arm Neoverse V2 (Grace CPU)12 |
专用加速引擎 | 232 个可编程 P4 MPU,支持硬件级压缩/解压与加解密引擎14 | 硬件加密加速、CRC 数据保护引擎、DOCA 硬件流水线加速2 |
板载内存与存储 | 64 GB 至 128 GB DDR5 (6400 MT/s),提供约 102 GB/s 带宽17 | 128 GB LPDDR5,114MB L3 缓存,板载 512 GB NVMe SSD12 |
核心软件生态 | P4/C/C++ 可编程数据平面、ROCm / ROCm AIC、SGLang UMBP6 | DOCA 微服务架构、NVIDIA NIXL、Dynamo (KVBM)、WEKA NeuralMesh8 |
典型系统集成形态 | 作为 AI 机架的前向网关,解耦南北向流量与安全隔离9 | 作为 Vera Rubin 机架阵列中 CMX 上下文存储层及超级计算节点2 |
两者的架构差异带来了显著的系统集成哲学区别:Pensando Salina 采用“流式数据流水线加速”架构,依托 232 个 P4 MPU 能够以微秒级延迟对海量并发数据包进行包头重构、负载匹配与零拷贝转发,极度节省功耗且不占用通用核心14;而 BlueField-4 则走向“重算力与多核并行”路线,通过 64 个 Grace CPU 核心与 512GB 板载存储,具备直接在 DPU 上运行复杂容器化存储软件(如 WEKA NeuralMesh)和完整调度控制面的能力12。
在 KV Cache 卸载与推理加速的软硬协同设计上,两家厂商根据自身芯片优势,构建了不同的技术体系。
AMD 针对 KV Cache 卸载的核心思路是“前向网关加速 + 调度感知多级存储池(Scheduler-Aware Multi-Tier Memory Pool)”3。在 ROCm 架构中,AMD 推出了 ROCm AIC(Infinity Context)框架,并深度整合至开源推理引擎 SGLang 及 MoRI 库中,构建了 UMBP(Unified Memory & Bandwidth Pool)机制6。传统的 KV Cache 存储层仅被视为被动的字节存储器,调度器无法感知远端节点的缓存热度与传输开销10。UMBP 通过全局 KV 放置目录,向推理调度器(如 mori-sched)暴露键值的历史访问次数、节点剩余容量、传输带宽直方图及 RPC 延迟10。
在前向传输层,Pensando Salina 依托 P4 可编程引擎线速处理基于 RoCEv2 或 UEC(Ultra Ethernet Consortium)协议的分布式数据搬运17。当发生 HBM 溢出时,Salina 触发 P2P(Peer-to-Peer)DMA 逻辑,将 KV 页面直接从 GPU/Host DRAM 搬运至网关级存储池,避免 CPU 处理协议栈3。此外,Salina 硬件内置的 LZRW1-A 压缩与 CRC 校验引擎,可在数据进入网络前实现线速实时压缩,降低网络带宽开销,同时不增加 GPU 的解压负担17。在超大规模数据中心的实际部署中,通过将软件定义网络、连接跟踪以及存储 Offload 集中至 Salina DPU,单台 AI 服务器成功释放了高达 22 个 Host CPU 核心,使得这些核心可完全用于处理智能体高层业务逻辑9。
NVIDIA 则依托全栈生态,围绕 BlueField-4 构建了名为 CMX(Context Memory Storage Platform)的 Pod 级推理上下文记忆体系2。在软件层,NVIDIA 推行 Dynamo 分布式 Serving 框架,并引入开源的 NIXL(NVIDIA Inference Transfer Library)作为统一传输抽象层7。Dynamo 内置的 KV 块管理器(KVBM)通过对 Token 序列进行哈希分块,实现精确的 Prefix-cache 跟踪7。NIXL 则屏蔽了底层的硬件差异,提供统一的非阻塞 API,能够自动选择最佳传输通道(NVLink、GPUDirect Storage、RoCE 或 NVMe-oF)8。

在 Vera Rubin 平台中,基于 BlueField-4 构建的 STX 架构引入了专门的共享上下文记忆层(G3.5),介于 GPU HBM(G1)与持久化对象存储(G4)之间2。BlueField-4 凭借其 64 核心 Grace CPU 的算力,可直接运行 WEKA NeuralMesh 或 DOCA 微服务,将跨机架的 NVMe SSD 聚合为一个高吞吐的共享 Token 仓库12。数据流直接利用 BlueField-4 内置的 ConnectX-9 800G 网络,配合 Spectrum-X 以太网进行零拷贝 RDMA 传输2。GPU 可以在不介入 Host CPU 的情况下,直接通过 GPUDirect Storage 协议从由 BlueField-4 管理的 CMX 节点读取历史 KV Cache2。实测数据表明,CMX 体系相比传统存储架构可实现高达 5 倍的 Tokens-Per-Second(TPS)提升,同时将推理功率效率提高 5 倍,配合 WEKA 部署时每瓦 Token 产出效率可提升高达 100 倍2。
典型的 DPU 驱动 KV Cache 卸载与读取工作流如下:
综合上述硬件架构与软硬件生态解构,AMD Pensando Salina 与 NVIDIA BlueField-4 在大模型推理基础设施中展现出了清晰的技术适用边界与商业定位差异。
AMD Pensando Salina 的核心优势在于开放性、高能效比与前向网络的高并发处理能力9。由于其采用了 P4 可编程架构与轻量级 Arm 核心组合,Salina 在处理南北向复杂 VPC 网络封包、线速防火墙、QoS 策略以及分布式存储解耦时功耗控制出色16。对于追求基础设施解耦、采用以太网开放架构(如 UALoE 或 UEC)、注重机架整体成本(Tokens per Dollar)的超大规模数据中心(Hyperscaler)或云服务提供商(CSP),Salina 是构建高性价比前向推理网关的合适选择9。
NVIDIA BlueField-4 的核心优势则在于计算性能、高带宽网络吞吐与深深植入闭环生态的端到端能力12。凭借 64 核心 Grace CPU 和 800G ConnectX-9 架构,BlueField-4 演变为超融合智算节点12。在追求极低 TTFT、大规模预填/解码分离部署,以及深度依赖 NVIDIA Dynamo/NIXL/GDS 生态的高性能智算工厂(AI Factories)中,BlueField-4 搭配 CMX 平台能够提供高确定性的上下文加速体验2。
针对智算基础设施架构师与技术决策者,提出以下可操作性选型与建设建议:
Note
根正苗红的 DPU、GPU 厂商都在不断加码推理场景的系统设计。其中,DPU 作为集合网络(流量密集)和存储(数据密集)的处理单元,成为厂商关注的重点。
AMD 此次推出 Pensando Salina DPU,为业界提供一个开源的 DPU 选择。尽管从功能设计和产品定位上来看,它还是处于从智能网卡向数据处理单元的过渡阶段,但这项技术为整个推理行业提供了调用 AMD 底层 GPU 的开放入口。
可以这么说,未来有自己 GPU 的厂商都应该积极布局 DPU 的访问路径设计,从而最大化数据访问链路过程中的流量优化和加速推理效率。
Notice:Human's prompt, Datasets by Gemini-3.6-Flash-DeepResearch ---【本文完】---