当前位置: 首页 > news >正文

NVIDIA Vera CPU技术详解:88核Olympus、176线程与1.2TB/s内存

NVIDIA于2026年7月21日进一步公开Vera CPU的Olympus核心、Spatial Multithreading、SCF、SOCAMM2内存、NUMA与I/O细节。Vera采用兼容Armv9.2-A的NVIDIA自研Olympus核心,定位不仅是GPU Host,也覆盖Agent沙箱、RL环境、数据处理与分析等CPU侧负载。

1.Vera CPU规格

项目

Vera CPU

架构

兼容Armv9.2-A,NVIDIA自研Olympus核心

核心 / 线程

88核 / 176线程

L1 / L2 / L3

每核64KB L1I、96KB L1D、2MB L2 / 每CPU 164MB统一L3

SIMD

每核6×128-bit SVE2,支持FP8

SCF

第二代,最高3.4TB/s双向截面带宽

内存

8个SOCAMM2模块,最高1.5TB LPDDR5X-9600

内存带宽

最高1.2TB/s,总计最高约14GB/s每核

NVLink-C2C

最高1.8TB/s双向一致性带宽

I/O

PCI Express Base Specification 6.4(PCIe 6.0代际)、CXL 3.1;单路最多88条、双路176条通道

功耗

可配置TDP 250W—450

2.Agent负载对CPU提出了什么要求

Agent循环会在GPU模型推理之外执行Python或JavaScript、编译代码、调用数据库和浏览器、读取检索结果、压缩数据并管理沙箱。这些路径通常分支密集、指针密集、指令依赖长,同时要运行大量并发环境。

因此CPU评估不能只看核心总数。单线程进度、满载时的每线程性能、内存带宽、共享缓存、NUMA访问和尾延迟,都会影响GPU等待工具结果的时间。

3.Olympus前端:10-wide与神经分支预测

Olympus前端使用高带宽取指和10-wide解码,公开资料显示取指单元每周期最多获取16条64-bit指令,并配有48条指令的Decode Queue。神经分支预测器针对统计偏置且难预测的分支;分支预测子系统每周期最多可处理两条预测为跳转的分支。

这类设计适用于解释器、运行时、编译器和图遍历等控制流复杂的软件。10-wide是解码宽度,不代表每周期一定退休10条指令;缓存未命中、数据依赖和分支错误仍会降低实际IPC。

4.Mid Core与执行引擎

中端包含宽重命名与分配、较大的重排序缓冲区和物理寄存器资源,通过内存重命名、值预测与关键路径加速降低长依赖链停顿。执行端包含4个Load与2个Store流水线,以及6组128-bit SVE2向量资源,其中部分支持加密运算;这些能力用于CPU侧向量与数据处理,不等同于GPU Tensor Core级大模型计算能力。

缓存子系统加入多类预取器,其中包括面向图与不规则访问的Graph Prefetcher。目标是提高内存级并行,减少指针追踪与图结构访问造成的串行等待。

5.Spatial Multithreading

每个Olympus核心支持两个硬件线程。NVIDIA将其称为Spatial Multithreading,强调对宽核心资源进行更有效的空间划分。核心既可让主线程运行关键任务、兄弟线程承接管理活动,也可为两个线程提供隔离程度更高的执行上下文。

该机制面向沙箱与多租户环境中的noisy-neighbor问题。公开资料没有提供所有资源的静态分区比例,具体调度方式、软件控制接口与不同负载下的收益仍需后续文档和独立测试确认。

6.SCF与统一L3

第二代Scalable Coherency Fabric连接88个核心、164MB统一L3、内存控制器、I/O和NVLink-C2C,提供最高3.4TB/s双向截面带宽。Vera把核心与共享缓存置于单一计算裸片,减少计算裸片之间的Hop。

SCF的作用是维持片上一致性与可预测访问路径。它与外部内存带宽是两个不同指标:3.4TB/s描述片上Fabric双向截面能力,1.2TB/s描述SOCAMM2内存子系统的聚合带宽。

7.SOCAMM2 LPDDR5X

Vera最高支持1.5TB SOCAMM2 LPDDR5X,聚合带宽最高1.2TB/s。SOCAMM2把LPDDR5X做成可现场更换的模块,在保留较短电气路径的同时满足服务器维护与RAS要求。

对高并发Agent、图分析、ETL、KV Cache卸载和RL环境,带宽可减少多核同时访问大工作集时的争用。容量与带宽仍要分开:1.5TB解决数据是否放得下,1.2TB/s解决数据供应速度。

8.单NUMA与双路扩展

每颗Vera对软件呈现一个NUMA域;双路系统是两个NUMA节点。两颗CPU通过第二代NVLink-C2C建立一致性连接。较简单的拓扑有利于线程、内存和I/O放置,也减少应用跨多个片内NUMA区调优的复杂度。

这并不等于NUMA问题消失。双路系统仍有本地与远端内存区别,应用仍需关注线程绑定、内存首次触碰和设备亲和性,只是节点数量与拓扑层级更清晰。

9.PCIe、CXL与机密计算

Vera支持PCIe 6.4和CXL 3.1,双路配置提供176条PCIe通道,可连接GPU、DPU、NIC、存储与CXL内存设备。CXL 3.1可用于一致性内存扩展、内存池化与可组合基础设施。

机密计算基于Arm CCA与RME,并包含RME-DA、RME-CDA设备分配、每VM加密密钥、TDISP设备隔离和C2C链路认证加密;MPAM可用于缓存与内存资源的分区和监控。它们属于硬件与平台能力,实际可用性仍取决于Hypervisor、操作系统、固件、驱动、设备和认证链支持。

10.性能结果如何解读

NVIDIA给出的“相对x86最高1.8倍”针对其选定的Agent CPU负载和满载时持续每线程性能,不代表Vera在全部CPU工作负载上普遍领先1.8倍。其双路预生产参考系统SPEC CPU 2026 Integer估算值为925,对照同样使用GNU 15.2的双路EPYC 9755为898。

测试边界|上述SPEC结果由NVIDIA于2026年7月内部测量并归类为估算值,不是SPEC正式提交。公开数据库中采用其他编译器和平台配置的EPYC 9755存在更高成绩,因此925对898不能写成通用吞吐排名。NVIDIA也尚未提供足够完整的同等级浮点数据,不能据此判断Vera在传统HPC浮点计算中的位置。

Phoronix已在NVIDIA提供的单路Vera平台上完成首轮Linux测试:88核176线程、8×96GB LPDDR5-9600、450W TDP、Ubuntu 24.04和GCC 16.1,覆盖编译、Python、Java、压缩、数据库与内存带宽等负载。该测试由第三方执行,但属于早期、有限平台验证,不替代OEM量产系统的长期测试。

11.Vera在系统中的位置

Vera Rubin NVL72使用36颗Vera CPU连接72颗Rubin GPU。在目标工作流中,Vera主要承接工具调用、数据处理、调度与CPU端执行,Rubin主要承担模型计算;实际任务划分取决于框架和应用实现。NVLink-C2C提供缓存一致性和统一地址空间能力,可减少部分显式数据复制,实际收益取决于CUDA、框架、内存管理与工作集访问方式。

12.总结

Vera的设计可以概括为:用宽核心和分支预测提高串行路径速度,用176线程提高环境密度,用SCF与SOCAMM2维持满载供数,用单NUMA和NVLink-C2C简化CPU—GPU协同。

http://www.jsqmd.com/news/1246359/

相关文章:

  • 2026龙岩新罗黄金回收全维度深度测评 六大片区正规门店综合对比解析 - 不晚生活号
  • AI产品A/B测试的实验设计:分流策略、指标选择与统计显著性的工程化实现
  • 2026年7月最新劳力士长沙开福天街维修保养服务电话 - 劳力士官方服务中心
  • BOM管理实战:制造业成本控制与效率提升指南
  • 亲身到店体验泉州亨得利名表服务中心|最新电话和维修地址(2026年7月更新) - 亨得利官方
  • AMD提出Agent Computer概念,PC与AC未来能否共存?
  • 深夜卡文破防?2026年全网最全10款写小说ai工具(内含避坑经验)
  • Lua与C/C++交互实战:从动态库编译到性能优化全解析
  • 石墨乳环保型厂家实力测评,零套路不踩坑,选购避坑指南 - myqiye
  • C++银行账户管理系统:从控制台项目掌握面向对象与文件操作
  • HybridSim:融合物理仿真与数据驱动的毫米波人体感知数字孪生平台
  • AI流量争夺战必看!选错损失百万:2026国内专业靠谱GEO管理系统权威排行榜
  • 亲身到店探访重庆欧米茄售后服务中心|完整电话和网点地址(2026年7月最新) - 欧米茄服务中心
  • 有人让Qwen3.6写了一套ERP,外包公司的活还能做多久?
  • URP下Shader Graph淡入淡出效果:从原理到实战的完整指南
  • 火车采集器|网页表格数据批量采集 + 导出完整方案
  • Tiva™ C系列MCU I2C主模式寄存器配置与调试实战指南
  • 2026年7月烟台欧米茄地址与热线电话最新服务通知 - 欧米茄服务中心
  • typedef与define的本质区别
  • 雷达宁波服务热线与网点地址2026年7月最新版——客户售后无忧 - 亨得利官方服务中心
  • 2026年7月最新积家天津滨海万达广场维修保养服务电话 - 积家官方售后服务中心
  • CDN技术演进:从MPLS管道到智能边缘计算
  • 2026年7月最新泰州海陵区城西街道亨得利名表服务中心电话公示 - 亨得利官方博客
  • 2026年7月最新欧米茄龙湖北京丽泽天街维修保养服务电话 - 欧米茄官方服务中心
  • 2026 年 7 月新发布:黄岛口碑好的泄爆墙板制造商哪家强,揭秘墙面惊人秘密:这泄爆墙板到底藏着什么?-柏舟抗爆墙 - 行业推荐官[官方】--
  • Gemini 3.0:智能开发工具链与React组件生成实战
  • Unity游戏模组开发实战:基于MelonLoader的代码注入与Harmony补丁技术
  • XXL-JOB时间轮机制解析与优化实践
  • 零碳园区建设方案思考:数字化能碳管理中心的八个关键能力
  • 轻量化与实时性——别拿嵌入式工程师不当人