首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >88核打128核!英伟达Vera CPU智能体AI性能6倍于AMD Turin

88核打128核!英伟达Vera CPU智能体AI性能6倍于AMD Turin

作者头像
芯智讯
发布2026-07-23 21:01:53
发布2026-07-23 21:01:53
2150
举报
NVIDIA Vera CPU 锁定 CoreWeave、Meta、Oracle 和阿里巴巴等早期买家,在 Rubin Racks 之外开辟数十亿美元的新市场
NVIDIA Vera CPU 锁定 CoreWeave、Meta、Oracle 和阿里巴巴等早期买家,在 Rubin Racks 之外开辟数十亿美元的新市场

7月22日消息,英伟达(NVIDIA)近日进一步披露了其首款自主研发数据中心CPU——Vera的完整性能数据,并将其与当前主流x86服务器处理器进行了详细对比。

根据英伟达公布的数据,Vera CPU是一款围绕Agentic AI(智能体AI)工作负载重新设计的数据中心处理器。在官方公布的多项测试中,仅拥有88个CPU核心的Vera,整体性能已全面领先拥有128个核心的AMD EPYC Turin(Zen 5)处理器,在Agentic AI相关负载下最高可实现6倍性能提升。其中,全新的Olympus CPU核心可将Agent工作负载性能提升2倍;基于单芯片(Monolithic)架构和NVIDIA Scalable Coherent Fabric一致性互连技术,实现了3倍核心间带宽;同时,全新的LPDDR5X内存子系统将内存访问延迟降低40%,进一步提升了Agentic AI推理过程中的响应速度和执行效率。

演示幻灯片展示了配备两个芯片的 NVIDIA Vera CPU,重点介绍了 NVIDIA Olympus Core 带来的“2 倍更快的代理速度”、“NVIDIA 可扩展一致性架构带来的“3 倍核心间带宽”以及 NVIDIA LPDDR5X 子系统带来的“降低 40% 的延迟”。
演示幻灯片展示了配备两个芯片的 NVIDIA Vera CPU,重点介绍了 NVIDIA Olympus Core 带来的“2 倍更快的代理速度”、“NVIDIA 可扩展一致性架构带来的“3 倍核心间带宽”以及 NVIDIA LPDDR5X 子系统带来的“降低 40% 的延迟”。
一张题为“NVIDIA Vera——面向智能时代的差异化架构”的对比幻灯片展示了“NVIDIA Vera CPU”(采用“Olympus Core”)和“传统芯片架构”。
一张题为“NVIDIA Vera——面向智能时代的差异化架构”的对比幻灯片展示了“NVIDIA Vera CPU”(采用“Olympus Core”)和“传统芯片架构”。

英伟达认为,Agentic AI时代对于CPU的需求已经发生根本变化,传统面向通用计算优化的x86架构已难以满足AI推理过程中大量分支判断、高并发线程以及高内存带宽等需求,而Vera正是围绕这些AI工作负载进行了重新设计。

聚焦Agentic AI,四大能力成为设计重点

此次公布的数据中,英伟达主要围绕四项关键能力评估Vera CPU的性能:

①内存带宽与访问延迟:验证高带宽内存、低延迟访问及一致性互连架构对数据供给能力的提升;

②应用负载性能:覆盖Agentic AI、数据分析、图计算等CPU密集型应用;

③核心IPC(每时钟周期执行指令数):重点展示全新Olympus微架构带来的执行效率提升;

④强化学习(RL)及Agentic AI性能:考察分支密集型、高并发、低延迟AI推理场景下的综合表现。

值得注意的是,此次官方测试主要将Vera与AMD最新一代EPYC Turin(Zen 5)服务器处理器进行了对比。

全新Olympus核心,大幅提升单线程执行效率

Vera最大的变化来自于全新的Olympus CPU微架构。

英伟达表示,Agentic AI涉及大量Python执行、代码编译、推理调度以及复杂控制流,因此CPU单线程性能和分支预测能力比传统服务器应用更加重要。

名为“单线程 IPC 增益”的柱状图显示,NVIDIA Olympus (Vera) 的性能比 AMD Zen5 (Turin) 高出 1.9 倍。
名为“单线程 IPC 增益”的柱状图显示,NVIDIA Olympus (Vera) 的性能比 AMD Zen5 (Turin) 高出 1.9 倍。

官方数据显示,在多个典型负载下,Vera核心IPC相比AMD Zen 5最高提升至原来的1.9倍。

神经网络分支预测器提升分支执行效率

为了应对AI程序大量条件判断和复杂控制流,Olympus采用了全新的神经网络分支预测器(Neural Branch Predictor),并结合多种专用预测单元,大幅提升CPU前端效率。

官方数据显示:Olympus内核的分支预测性能最高提升2.3倍;平均提升约2倍;每周期可处理Taken Branch数量最高提升3.5倍。

名为“每个周期分支预测”的条形图显示,NVIDIA Olympus (Vera) 的每个周期分支预测次数比 AMD Zen5 (Turin) 高出 2.3 倍。
名为“每个周期分支预测”的条形图显示,NVIDIA Olympus (Vera) 的每个周期分支预测次数比 AMD Zen5 (Turin) 高出 2.3 倍。
名为“每个周期的分支数”的条形图显示,NVIDIA Olympus (Vera) 在所有基准测试中都优于 AMD Zen5 (Turin),在 723.llvm_r (est) 中性能最高可达 3.5 倍。
名为“每个周期的分支数”的条形图显示,NVIDIA Olympus (Vera) 在所有基准测试中都优于 AMD Zen5 (Turin),在 723.llvm_r (est) 中性能最高可达 3.5 倍。

英伟达表示,更精准的分支预测意味着CPU能够持续向执行流水线提供有效指令,减少错误预测造成的流水线清空,从而降低无效周期,提高整体执行效率。

无需uOP Cache,指令获取能力提升2.4倍

Olympus核心还重新设计了CPU前端。相比x86处理器普遍依赖uOP Cache缓存微指令,Olympus直接采用:64KB一级指令缓存(Instruction Cache)、每周期128Byte高带宽取指、10宽(10-wide)指令解码器。

官方数据显示,其每周期指令获取能力(Instruction Fetch Operations)最高达到AMD Zen 5的2.4倍。

名为“每个周期的指令获取操作”的柱状图显示,NVIDIA Olympus (Vera) 的性能优于 AMD Zen5 (Turin),每个周期的操作次数最多可高出 2.4 倍。
名为“每个周期的指令获取操作”的柱状图显示,NVIDIA Olympus (Vera) 的性能优于 AMD Zen5 (Turin),每个周期的操作次数最多可高出 2.4 倍。

与此同时,Olympus后端执行单元也进行了大幅扩展。数据显示,其Backend Operations吞吐能力:峰值提升4.3倍,平均提升超过3倍。

名为“每个周期的后端操作”的柱状图显示,在不同的基准测试中,NVIDIA Olympus (Vera) 的性能比 AMD Zen5 (Turin) 高出 4.3 倍。
名为“每个周期的后端操作”的柱状图显示,在不同的基准测试中,NVIDIA Olympus (Vera) 的性能比 AMD Zen5 (Turin) 高出 4.3 倍。

整体来看,Olympus通过扩大前端解码宽度、优化分支预测以及增强执行资源,使CPU在复杂AI程序中的单线程性能实现了显著提升。

单芯片设计破解Chiplet瓶颈

除了核心架构,英伟达此次重点强调了Vera采用Monolithic(单芯片)设计的重要意义。

目前主流x86服务器CPU,包括AMD EPYC Turin,均采用Chiplet架构,即多个计算芯粒(CCD)通过I/O Die互连组成完整处理器。

题为“NVIDIA Vera——单芯片避免了芯片税”的演示幻灯片展示了与传统芯片架构相比,使用 NVIDIA NVLink-C2C 的单芯片增强了数据传输能力。
题为“NVIDIA Vera——单芯片避免了芯片税”的演示幻灯片展示了与传统芯片架构相比,使用 NVIDIA NVLink-C2C 的单芯片增强了数据传输能力。

虽然Chiplet有利于提升制造良率,但随着AI工作负载越来越依赖大量核心间通信,其弊端也逐渐显现。

英伟达指出,当数据需要跨CCD传输时,需要经历:CPU核心 → CCD → I/O Die → 另一CCD → 目标核心。

每增加一次Die间跳转,都会增加:通信延迟;Fabric带宽占用;核心间通信的不确定性。这些都会影响Agentic AI推理效率。

而Vera采用单芯片设计,所有CPU核心位于同一硅片内部,可避免上述问题。

官方公布的Core-to-Core延迟热力图显示,相比AMD EPYC 9755:Vera核心间通信延迟降低约50%;所有CPU核心之间保持一致的低延迟表现,不会因物理位置不同而出现性能波动。

对比图表显示,AMD Turin 9755 的延迟较高(以红色方块为主),NVIDIA Vera CPU 的延迟较低(以绿色为主),并附有文字说明:“Vera 提供确定性性能,延迟降低 50%”。
对比图表显示,AMD Turin 9755 的延迟较高(以红色方块为主),NVIDIA Vera CPU 的延迟较低(以绿色为主),并附有文字说明:“Vera 提供确定性性能,延迟降低 50%”。

英伟达认为,这种一致性的低延迟对于AI推理尤为重要。

内存带宽达到EPYC Turin四倍

针对AI推理中大量随机访问数据的特点,英伟达也重点强化了Vera的内存子系统。

官方数据显示:AMD EPYC Turin拥有128个CPU核心,每个核心平均可获得约3.1GB/s内存带宽。

相比之下,Vera虽然只有88个核心,但每个核心平均可获得约12.7GB/s内存带宽,在部分应用中甚至可达到14GB/s。

名为“每个核心的内存带宽”的柱状图显示,NVIDIA Vera CPU 的带宽为 12.7 GB/s,超过了 AMD Turin 9755 的 3.1 GB/s。
名为“每个核心的内存带宽”的柱状图显示,NVIDIA Vera CPU 的带宽为 12.7 GB/s,超过了 AMD Turin 9755 的 3.1 GB/s。

也就是说,Vera单核心内存带宽约为AMD EPYC的4倍。

此外,在内存压力测试中,随着带宽需求增加,AMD EPYC Turin内存访问延迟由约120ns迅速升高至约350ns。

而Vera不仅能够提供约3倍内存带宽,在90%内存利用率下,其峰值访问延迟甚至可降低至AMD平台的约1/40。

一张名为“NVIDIA Vera—负载下延迟降低 40%”的图表显示,NVIDIA Vera 的内存延迟比 AMD Turin 9755 更低,并突出显示了 400 GB/s 处的“内存墙”。
一张名为“NVIDIA Vera—负载下延迟降低 40%”的图表显示,NVIDIA Vera 的内存延迟比 AMD Turin 9755 更低,并突出显示了 400 GB/s 处的“内存墙”。

英伟达认为,对于Agentic AI而言,大量线程需要同时访问规模庞大且分布不规则的数据集,因此系统瓶颈更多来自内存而非CPU算力本身,高带宽、低延迟内存系统的重要性正不断提高。

Python性能最高提升1.8倍

在实际应用测试中,英伟达重点展示了Agentic AI相关软件栈表现。

测试涵盖:Python运行、软件编译、静态代码分析、自动化软件工具链。

结果显示,Vera单核心性能相比AMD EPYC最高提升:Python性能提升了1.8倍;其他软件工作负载提升了最高约1.7倍。

题为“NVIDIA Vera 性能提升近 2 倍”的柱状图显示,NVIDIA Vera 88C 在各种工作负载下均优于 AMD Turin 128C,在 Agentic 任务中性能提升尤为显著,达到 1.8 倍。
题为“NVIDIA Vera 性能提升近 2 倍”的柱状图显示,NVIDIA Vera 88C 在各种工作负载下均优于 AMD Turin 128C,在 Agentic 任务中性能提升尤为显著,达到 1.8 倍。

英伟达官方表示,这些测试均在CPU满载情况下完成,因此能够更加真实反映数据中心实际部署场景。

图计算性能最高提升29倍

由于AI知识图谱、RAG等应用大量依赖图计算(Graph Processing),英伟达也公布了多项图计算测试结果。

其中,Graph Traversal(图遍历)性能相比AMD EPYC提升约2.6倍。

名为“PageRank 图遍历”的条形图显示,NVIDIA Vera CPU 的得分比 AMD Turin 9755 高 2.6 倍。
名为“PageRank 图遍历”的条形图显示,NVIDIA Vera CPU 的得分比 AMD Turin 9755 高 2.6 倍。

而在PageRank算法测试中:随着核心数量增加,Vera展现出极佳扩展能力。在32核心配置下,其性能最高达到AMD平台的29.3倍。

名为“图遍历核心扩展页面排名”的条形图显示,NVIDIA Vera CPU 在所有核心数上都优于 AMD Turin 9755,其中 32 核心的差异最为显著,NVIDIA 的相对性能是 AMD 的 29.3 倍,而 AMD 的相对性能是 AMD 的 10.3 倍。
名为“图遍历核心扩展页面排名”的条形图显示,NVIDIA Vera CPU 在所有核心数上都优于 AMD Turin 9755,其中 32 核心的差异最为显著,NVIDIA 的相对性能是 AMD 的 29.3 倍,而 AMD 的相对性能是 AMD 的 10.3 倍。

英伟达表示,这主要得益于:更高内存带宽、更大的缓存效率、更低核心通信延迟。

ClickHouse数据库性能提升20%

除了AI推理,官方还展示了数据库分析能力。在列式数据库ClickHouse测试中:Vera相比AMD EPYC Turin性能提升约20%。

名为“ClickHouse”的柱状图显示,NVIDIA Vera CPU 的性能比 AMD Turin 9755 高出 1.2 倍。
名为“ClickHouse”的柱状图显示,NVIDIA Vera CPU 的性能比 AMD Turin 9755 高出 1.2 倍。

ClickHouse广泛应用于:在线分析处理(OLAP)、数据仓库、ETL(抽取、转换、加载)、大规模数据聚合分析。

英伟达认为,Vera对于高并发分析型数据库同样具有较好的适应能力。

瞄准2000亿美元CPU市场

英伟达认为,随着Agentic AI成为下一阶段AI发展的核心方向,传统服务器CPU市场也将迎来重构。

英伟达此时大举进军CPU市场,背后是AI基础设施底层逻辑的剧变。随着AI工作负载从大规模预训练转向复杂的推理和智能体任务,硬件配比正在发生倾斜。传统的“8 GPU配1 CPU”模式在智能体场景下失效,取而代之的是在某些情况下接近1:1的配比。因为智能体需要CPU执行代码、调用工具、与数据库交互,这些分支密集、指针密集型的长尾操作极度依赖单线程性能 。

目前英伟达第一代数据中心CPU——Grace总出货量已经突破250万颗,英伟达超大规模与高性能计算副总裁、CUDA之父Ian Buck近日还透露,其Grace独立服务器(即不捆绑GPU)的出货量也已达“数十万台”,这表明其在CPU市场的渗透远比外界想象的更深远 。

Grace CPU采用的是Arm Neoverse V2公版核心,可视为英伟达叩开数据中心CPU大门的“敲门砖”。如今,这道门缝已被彻底拉开,因为真正的杀手锏——Vera CPU已经登场。

英伟达预计,到2026年,Vera有望成为AI数据中心部署规模最大的CPU平台之一。

目前,包括OpenAI、Anthropic、SpaceX、Perplexity等多家AI企业已开始部署Vera平台。

题为“NVIDIA Vera——强大的生态系统采用”的演示幻灯片重点列出了早期采用者、超级计算中心、云提供商和生态系统合作伙伴,左侧显示了一台服务器和一张显卡。
题为“NVIDIA Vera——强大的生态系统采用”的演示幻灯片重点列出了早期采用者、超级计算中心、云提供商和生态系统合作伙伴,左侧显示了一台服务器和一张显卡。

与此同时,Vera也将陆续进入各类超级计算中心、云计算数据中心,并获得更多服务器厂商及生态合作伙伴支持。

小结:

从此次公布的架构及性能数据来看,Vera并非简单意义上的Arm服务器CPU,而是一款围绕Agentic AI重新定义的数据中心处理器。

与当前主流x86服务器CPU相比,Vera最大的特点并非单纯提升CPU核心数量,而是针对AI推理中的高带宽、低延迟、高并发以及复杂控制流等特点,对CPU微架构、内存系统及片内互连进行了系统性优化。

尤其是单芯片(Monolithic)设计、高带宽内存架构以及Olympus微架构,使其在Python执行、图计算、强化学习等Agentic AI核心工作负载中展现出明显优势。

未来,随着Agentic AI、大模型推理和AI智能体应用持续快速增长,CPU作为AI基础设施的重要组成部分,其架构设计也将逐步从传统通用计算转向更加贴近AI工作负载的方向。而Vera,正是英伟达在这一趋势下推出的重要产品。

编辑:芯智讯-浪客剑

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-23,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档