Welcome-球速(体育科技有限公司)-AI工厂需要怎样的数据中心?英伟达Vera Rubin给出了答案
2026-08-11 13:48:41||273次|新闻资讯

【导读】年夜模子竞争进入推理阶段后,AI基础举措措施面临的使命已经经及预练习期间有了较着不同。已往数年,练习年夜模子是AI基础举措措施设置装备摆设的主攻标的目的。如今到了AI工场时代,Token最先成为权衡产出的基本单元,推理,特别是代办署理式AI,逐渐成为数据中央承载的主要事情负载。

代办署理式AI需要处置惩罚的内容远比一次模子问回复杂。模子吸收用户输入后,可能需要天生推理历程,挪用搜刮、数据库及企业软件,履行代码并拜候外部东西,末了再对于成果举行验证。多个智能体协作时,一项使命还有会于差别模子、软件办事及履行情况之间重复流转。

这些事情其实不都合适交给GPU完成。GPU卖力模子计较,CPU需要运行沙箱、编译代码、挪用东西及治理履行情况;推理天生阶段又同时面对高吞吐量及低延迟要求;不停扩展的KV Cache则最先占用更多内存及存储资源。当使命链路愈来愈长,零丁提高GPU峰值算力已经经很难动员整套体系同步提速。

于如许的事情负载变化下,英伟达打造出一套以Vera Rubin为基础的POD级AI基础举措措施。超等平台包罗Vera CPU、Rubin GPU、Groq 3 LPU、BlueField-4 DPU、NVLink 6互换芯片、ConnectX-9 SuperNIC及Spectrum-6以太网互换芯片七款焦点芯片,并构成GPU计较、CPU沙箱、低延迟推理、上下文存储及收集五类机架级体系。

这五类体系别离处置惩罚高吞吐量计较、密集型CPU使命、低延迟Token天生、KV Cache存储及集群通讯,再经由过程同一的收集、供电、液冷及机械架构毗连成一座POD级AI工场。

Vera Rubin的设计重点也由单颗芯片机能,扩大处处理器分工、机柜毗连及数据中央基础举措措施的总体协同。

1784110502147249.png

五类机架级体系配合构成一台POD级AI超等计较机

CPU从头成为AI体系的要害资源

于强化进修及智能体运用中,CPU可能成为整套体系的瓶颈。跟着智能体轮回中的代码编译、剧本履行、东西挪用及情况验证使命增长,GPU吞吐量晋升其实不能同步缩短这些环节的处置惩罚时间。强化进修情况及智能体沙箱连续扩张后,CPU机柜于AI集群中的配置范围也最先增长。

Vera CPU采用88个英伟达自研Olympus焦点,并引入Spatial Multithreading空间多线程技能。与多个线程高度同享焦点资源的常见多线程设计比拟,Spatial Multithreading会为两个硬件线程划分部门焦点资源,削减高并发负载下的资源争用,使单个沙箱使命的履行时间越发不变。单颗CPU可以运行176个硬件线程,内存带宽到达1.2TB/s,每一个插槽至多配置1.5TB LPDDR5X SOCAMM内存。与传统办事器DIMM比拟,SOCAMM可以同时保留LPDDR的带宽及能效上风,以和办事器需要的模块化矫捷改换能力。

一套自力的Vera CPU液冷机柜至多可以安装256颗CPU。根据英伟达宣布的数据,单机柜可以同时维持跨越22500个强化进修或者智能体沙箱情况。

别的,Vera还有会以多种形态进入数据中央。它可以作为Vera Rubin NVL72中的主机CPU,经由过程NVLink-C2C与Rubin GPU慎密毗连;也能够进入HGX Rubin NVL8等加快办事器平台。自力部署时,Vera还有可以构成单路或者双路办事器,负担数据处置惩罚、HPC、云基础举措措施及存储使命;于BlueField-4 STX中,Vera CPU又与ConnectX-9 SuperNIC联合,进入上下文存储基础举措措施。英伟达由此把Vera扩大到了GPU主机、CPU密集型机柜、通用办事器及存储体系等多个位置。

于英伟达给出的对于比数据显示,Vera CPU的代办署理式沙盒机能和内存带宽机能均高在X86。

1784110517557446.png

1784110566868015.png

NVL72机架级计较引擎

CPU职位地方上升,并无减弱GPU于Vera Rubin中的计较焦点位置。Vera Rubin NVL72集成72颗Rubin GPU及36颗Vera CPU,由18个计较托盘及9个NVLink互换托盘构成。每一个计较托盘安装两组Vera Rubin Superchip,机柜内部的72颗GPU再由NVLink构成一个年夜型计较域。

NVLink负担的是Scale-up使命,它把统一个机架中的GPU构造成一个高带宽计较域,模子参数、激活值及中间成果可以于GPU之间高速互换。

NVLink互换芯片还有可以履行部门收集内计较,把数据规约及调集通讯中的部门处置惩罚移出GPU,由此削减GPU的通讯治理开消。

加码推理,LPU呈现

英伟达于2026年将Groq 3 LPU插手Vera Rubin,形成自力的LPX推理机柜。每一个LPX机柜包罗256颗LPU,采用片上SRAM及确定性履行架构,面向低延迟Token天生。LPX会与NVL72共同利用,Rubin GPU处置惩罚长上下文、Attention及计较密集型使命,LPU负担部门逐Token解码及MoE专家计较。

预填充阶段需要一次处置惩罚完备输入上下文,矩阵范围年夜、并行度高,GPU可以充实阐扬计较吞吐及HBM容量。但到了Decode阶段,根据自回归方式逐个天生Token,每一一轮都要等候上一轮成果,计较颗粒更小,用户对于延迟也越发敏感。

推理模子最先天生数千甚至数万个思索Token后,Decode占用的时间迅速增长。扩展Batch可以提高GPU总吞吐量,也会让一个哀求于行列步队中等候更永劫间。高吞吐量及低交互延迟很难于统一种配置下同时到达。

这套分工把推理进一步拆开:GPU寻求总体吞吐量,LPU缩短用户等候每一个Token的时间,CPU则卖力履行东西及验证成果。三类处置惩罚器需要重复互换状况及中间数据,体系机能愈来愈依靠调理软件及收集可否正确地把使命送到适合的硬件。

英伟达宣布的测试中,Vera Rubin NVL72与LPX组合于特定万亿参数模子上,相较Blackwell可得到最高35倍Token产出及最高10倍收入时机。

1784110608223777.png

存储正于变患上极为主要

推理范围扩展后,另外一个快速增加的资源是KV Cache。

KV Cache是已经经计较过的上下文状况,模子天生下一个Token时,可以直接读取这些成果,无需从头计较全数汗青内容。谈天呆板人凡是只于一次对于话中保留上下文,智能体需要持久生存使命方针、东西挪用成果、中间推理及其他智能体返回的数据,多个办事还有可能反复拜候统一份上下文。

现有推理体系凡是把KV Cache放于GPU HBM中。HBM速率快、成本高、容量有限,空间不足后,数据会依次下沉到CPU内存、当地SSD及收集存储。每一降落一级,容量增长,拜候延迟也会上升。GPU等候KV Cache返回时,Decode流程会暂停,体系吞吐量随之降落。

传总共享存储缭绕永世数据设计,需要处置惩罚多副本、数据掩护、一致性及持久生存。KV Cache属在推理历程中孕育发生的姑且状况,部门数据丢掉后也能够从头计较。两类数据的拜候特性及靠得住性要求差异很年夜,英伟达由此于GPU及CPU内存以外,增长了面向KV Cache的CMX Context Memory Storage。它以BlueField-4 STX机柜为基础,于POD内部提供一层高带宽、可同享的上下文存储,使KV Cache可以于差别轮次、会话及智能体之间反复利用,削减GPU HBM容量占用及远端同享存储拜候。

英伟达的CMX可基在BlueField-4 STX机柜构建, NVIDIA BlueField-4 STX 机架采用 NVIDIA BlueField-4 处置惩罚器,该处置惩罚器联合了 Vera CPU 及 ConnectX-9 SuperNIC,并经由过程 Spectrum-X 以太网收集举行横向扩大。BlueField-4卖力NVMe拜候、数据完备性、加密及KV数据传输,Spectrum-X提供低延迟的RDMA收集。体系可以于Decode最先前,把行将利用的数据提早送入GPU或者者主机内存,从而削减GPU等候。

英伟达称,CMX于长上下文及智能体推理中可以带来最高5倍的连续Token吞吐量,以和最高5倍在传统存储的能效。这些指标属在厂商测试成果,CMX的体系价值仍旧轻易理解:昂贵的HBM可以生存最活跃的数据,更年夜范围的推理上下文进入一个针对于KV Cache优化的同享层,GPU是以削减反复计较及远端存储等候。

1784110642974938.png

如图所示,G3.5的CMX 位在当地SSD及收集存储同享之间,提供了有用数据缓冲。

面临差别数据流的收集拓扑

计较、CPU履行、低延迟解码及上下文存储被拆分到差别机柜后,收集需要处置惩罚的数据流也需要分层传输,AI工场中的收集可以归纳为五类:Scale-up、Scale-out、Scale-across、存储收集及治理收集。

Scale-up卖力毗连统一个计较域内的GPU。于Vera Rubin NVL72中,NVLink 6将72颗Rubin GPU构成一个高带宽计较域,用在模子并行、GPU内存拜候及高频调集通讯,对于带宽、延迟及抖动提出了极高要求。

Scale-out指工具向扩大,卖力毗连多个机柜。英伟达同时提供InfiniBand及Spectrum-X Ethernet。InfiniBand持久办事在HPC及并行计较,RDMA、无损收集以和调集通讯机制较为成熟;Spectrum-X面向已经经拥有年夜量以太网基础举措措施的云厂商及企业,使这些客户继承利用已经有的运维系统、收集人材及治理软件。用户可以按照本身需求矫捷选择部署。

Scale-across则卖力毗连差别数据中央。跟着AI工场的扩展,单个园区的电力、地盘及冷却容量有限,AI集群可能部署于多个修建、多个园区甚至相距数百千米的举措措施中。长间隔通讯会增长流传延迟及带宽时延积,机房内部利用的堵塞节制参数难以直接套用。英伟达的Spectrum-XGS技能,经由过程拓扑感知堵塞节制、延迟治理及端到端遥测,让漫衍于差别举措措施中的算力介入统一套AI使命。英伟达称,其于跨数据中央情况中的NCCL机能最高可提高1.9倍。

1784110641551107.png

传统企业数据中央中,一台办事器或者者虚拟机可以自力处置惩罚年夜部门营业。单个数据包延迟略有颠簸,凡是只会影响一个哀求。而AI练习需要面向数千颗GPU,一轮当地计较竣事后,所有节点要经由过程All-Reduce、All-Gather或者All-to-All互换数据,再进入下一轮计较。

是以,不克不及由于一颗处置惩罚器的收集堵塞影响其他GPU。收集抖动影响的规模也由一个哀求扩展到整个练习集群。AI收集需要同时存眷有用带宽、尾延迟、丢包率、堵塞恢复时间以和每一轮通讯耗时是否不变。这需要无损、低延迟及靠近零抖动的收集。

CPO量产举行时

数据中央除了了芯片耗能以外,收集装备的功耗一样不容轻忽。传统可插拔光模块速度晋升到800Gb/s及1.6Tb/s后,其内部电芯片的耗电量激增,旌旗灯号损耗、驱动功耗及散热压力城市较着晋升。

使用CPO(共封装光学)技能,可以把硅光引擎放到互换芯片封装四周,将高速电旌旗灯号的传输间隔缩短到毫米级,随后及早转换成光旌旗灯号,从而削减收集功耗及延迟。

Spectrum-X Ethernet Photonics基在Spectrum-6,最高互换容量到达409.6Tb/s。与可插拔光模块方案比拟,CPO可以得到5倍收集能效,并将AI运用的连续运行时间提高5倍。同时,CPO不需要传统DSP重按时器,可以缩短收集延迟。

MGX及DSX把协同设计延长到机房

英伟达MGX提供开放式模块化参考架构,使 OEM、ODM 及生态体系互助伙伴可以或许更快地构建加快体系,对于在体系组装商而言,MGX 经由过程利用同享参考设计将每一个平台的研发成本降低 200 – 400 万美元。

虽然 NVIDIA MGX NVL 机架提供年夜范围纵向扩大的计较域,但代办署理式 AI 事情流需要高度专业化的节点来实现超低延迟推理、CPU 沙盒及用在 KV 缓存的加快上下文内存。为满意这些差别需求,Vera Rubin 推出了 MGX ETL 机架架构,这是一种彻底可配置的全新 MGX 机架,其设计采用 Spectrum-X 以太网骨干或者直接芯片到芯片骨干,使用与 MGX NVL 机架不异的机架级生态体系。

MGX ETL与MGX NVL采用不异的机架尺寸,并同享重要机械布局、铜缆违板、供电及液冷部件。OEM及ODM可以于不异的机房前提与供给链系统下,构建GPU计较、CPU沙箱、LPX推理及BlueField-4 STX存储机柜,削减差别体系别离开发及验证的成本。

功率治理也进入协同设计规模。AI练习及推理会孕育发生快速负载变化,于机架层面,Vera Rubin NVL72 经由过程功率光滑技能来均衡功率颠簸,并集成为了比 Blackwell Ultra 多 6 倍的局部能量缓冲,可以或许于源端直接接收快速的功率瞬变,这套机制可以将峰值电流需求降低最高25%。别的,MGX还有撑持45℃进水温度及5000A液冷母排,较高的进水温度可以削减部门地域对于压缩机制冷的依靠。

NVIDIA Vera Rubin DSX 则是一个 AI 工场平台,可为配合设计的 AI 基础举措措施 (从芯片到电网) 提供蓝图及参考设计。AI工场设置装备摆设前,厂商可以于Omniverse数字孪生中模仿收集和谈、端口配置、机柜结构、功率分配及冷却效果,提早举行体系仿真,从而提早举行各种指标评估,防止返工。

经由过程协同设计,拓展整条推理供给链

Vera Rubin最值患上存眷的变化,可能并不是某一颗芯片增长了几多算力,而是英伟达最先缭绕推理及智能体使命从头分配体系资源,Vera Rubin也是英伟达迄今为止的集年夜成者。

GPU仍旧是重要的模子计较引擎,CPU需求上升后,英伟达用Vera笼罩智能体沙箱、强化进修及通用数据处置惩罚;Decode对于延迟的要求,使患上LPU+SRAM进入了推理流程中;KV Cache容量连续扩展,则使用BlueField-4及CMX形成新的存储形态;末了用差别的收集毗连拓扑将体系组成POD甚至更年夜范围的集群,诸如NVLink、Spectrum-X、InfiniBand及Spectrum-XGS等等,从而打造出真实的AI工场。

当基础举措措施扩大到POD范围,AI体系的评价维度理应随之增长。单颗GPU的峰值机能仍旧主要,Token天生速率、单用户延迟、每一瓦吞吐量、GPU有用使用率、体系连续运行时间及CPU沙箱处置惩罚能力,也最先配合决议一座AI工场的现实产出。

Vera Rubin代表了英伟达于推理时代的一次能力界限扩张。产物界说已经不只是GPU及办事器,也包括差别处置惩罚器之间的使命分工、机柜之间的收集毗连,以和从功率分配、液冷到机房设置装备摆设的总体协同。

gg_20260512171736_266_20260622170931_179.png

-Welcome-球速(体育科技有限公司)


相关阅读

全国服务热线
400-607-5688
公司地址
北京市昌平区回龙观高新四街 6号院1号楼5层
公司邮箱
www@qiusu.com
版权所有:球速体育科技有限公司  京ICP备18004735号-1 京公网安备 11011402010817号
400-607-5688
在线咨询
京东商城
返回顶部
电话咨询
在线咨询
返回顶部