NVIDIA levert tot 30 keer meer prestaties per MW met Vera Rubin vergeleken met Blackwell

NVIDIA heeft nieuwe voorlopige resultaten gepubliceerd van Vera Rubin NVL72 die wijzen op een aanzienlijke sprong in de inference-efficiëntie voor artificiële intelligentie. In tests uitgevoerd door het bedrijf zelf met de SemiAnalysis AgentX-benchmark, bereikt het nieuwe platform tot 30 keer meer throughput per megawatt dan GB300 NVL72 en een kostenbesparing tot 35 keer per miljoen tokens onder bepaalde omstandigheden. De resultaten dienen nog gecontroleerd te worden door SemiAnalysis.

De kernpunten van NVIDIA Vera Rubin in 30 seconden

  • Vera Rubin NVL72 behaalt tot 30 keer meer throughput per megawatt dan GB300 NVL72 in DeepSeek V4 Pro.
  • NVIDIA schat een kostenreductie tot 35 keer per miljoen tokens vergeleken met Blackwell in deze tests.
  • AgentX simuleert echte sessies van programmeeragents, met groeiende context en calls naar tools.
  • Blackwell verbetert ook: GB300 haalt tot 15 keer de prestaties per MW van H200 met DeepSeek V4 Pro.
  • De cijfers van Vera Rubin zijn door NVIDIA gemeten en worden nog bevestigd door SemiAnalysis.

Deze vergelijking is bijzonder interessant omdat NVIDIA niet alleen meet hoeveel tokens een GPU kan genereren in een statisch testscenario. AgentX probeert scenarios te reproduceren die veel meer lijken op het werkelijke gedrag van nieuwe AI-agents, waar een enkele taak reasoning, calls naar tools, subagents en opeenvolgende verzoeken omvat, met een context die tijdens de sessie toeneemt.

Dit beïnvloedt ook de metrics die belangrijk worden voor datacenters. Maximale prestaties van een accelerator blijven relevant, maar voor operators die decennia of honderden racks inzetten, tellen de tokens per megawatt, latentie, tijd tot eerste token en de kosten per miljoen tokens.

Vera Rubin tot 30 keer de throughput per megawatt

AgentX maakt deel uit van InferenceX, de open benchmark suite van SemiAnalysis. In plaats van uitsluitend kunstmatige sequenties met vooraf bepaalde lengtes, reproduceert het vooraf opgenomen sessies van programmeeragents.

De tests behouden elementen zoals de groei van de context, variabele invoer- en uitvoerlengte, reasoning-tijden en wachttijden door calls naar tools. Ze variëren ook de gelijktijdigheid om de relatie tussen totaalprestaties en reactietijd voor elke gebruiker te observeren.

In DeepSeek V4 Pro beweert NVIDIA dat Vera Rubin NVL72 tot 30 keer meer throughput per megawatt behaalt dan GB300 NVL72 bij ongeveer 160 tokens per seconde per gebruiker.

Dit betekent niet dat Vera Rubin 30 keer sneller is dan Blackwell onder alle omstandigheden. Het betreft een specifiek punt op de prestatiecurve van AgentX, gecombineerd met een bepaalde model- en interactiviteitsconfiguratie.

Deze precisie is belangrijk omdat NVIDIA eerder aankondigde dat Vera Rubin verbeteringen bood van ongeveer 10 keer in performance per watt en 10 keer in kosten per token ten opzichte van Blackwell voor andere inference-scenario’s. De nieuwe resultaten verschillen niet noodzakelijk, ze komen voort uit een ander soort AI-workload en een andere methodologie.

In AgentX kan het platform ook hogere niveaus van interactiviteit bereiken dan GB300 NVL72. Grafieken van NVIDIA tonen dat Vera Rubin blijft opschalen naar niveaus waar Blackwell zijn limieten begint te bereiken.

De firma koppelt deze verbetering aan een bredere aanpak dan alleen de GPU Rubin. De architectuur van Vera Rubin is ontworpen rondom het volledige systeem: GPU, CPU, geheugen, interconnect, netwerken en software werken samen om dataoverdrachten, wachttijden en herberekeningen te minimaliseren.

Tot 35 keer lagere kosten per miljoen tokens

Een andere opvallende factor heeft meer directe economische implicaties. NVIDIA zegt dat Vera Rubin NVL7235 keer lagere kosten per miljoen tokens behalen dan GB300 NVL72 in de nieuwe workloads.

Nogmaals, het gaat om een maximumwaarde onder de specifieke condities die NVIDIA hanteert; dit betekent niet automatisch dat alle AI-services die overschakelen van Blackwell naar Rubin deze kostenbesparing realiseren.

Toch biedt deze metriek inzicht in de richting waarin de AI-infrastructuur zich beweegt. In de eerste fase van generatieve AI lag de focus vooral op het inzetten van zoveel mogelijk GPU’s. Met grootschalige inference wordt het belang van de hoeveelheid bruikbare werkbelasting per GPU groter, vooral per megawatt beschikbaar in het datacenter.

Voor operators met beperkte elektrische capaciteit maakt het verhogen van de tokens binnen hetzelfde energiebudget het mogelijk meer verzoeken te verwerken zonder die infrastructuur proportioneel uit te breiden.

NVIDIA optimaliseert dit proces daarnaast via haar DSX MaxLPS-technologie, die de energiebeheer op GPU-, rack- en workload-niveau regelt. Volgens het bedrijf kan hiermee tot 40 % meer GPU’s binnen hetzelfde megawattbudget worden geïnstalleerd.

Zo wordt de beschikbare elektriciteit een belangrijke maat voor de ware capaciteit van AI-infrastructuur.

Blackwell verbetert ook ten opzichte van Hopper

De nieuwe gegevens beperken zich niet tot Rubin. NVIDIA heeft AgentX gebruikt om de evolutie te meten van haar huidige generatie Blackwell ten opzichte van Hopper.

Met DeepSeek V4 Pro 1.6T behaalt GB300 NVL72 tot 15 keer meer throughput per megawatt dan H200 NVL8, volgens de gepubliceerde resultaten. De kosten per miljoen tokens kunnen wel tot tien keer lager uitvallen.

Het verschil wordt groter bij grotere modellen.

In tests met Kimi K3 2.8T plaatst NVIDIA GB300 NVL72 op ongeveer 80 keer meer throughput per megawatt dan H200 NVL8 bij vergelijkbare interactiviteitsniveaus. Blackwell kan in dit scenario ook een interactieve snelheid van ongeveer 215 tokens per seconde per gebruiker bereiken.

De verbeteringen komen deels door hardware, maar NVIDIA wijt een ander deel aan software. Gebieden zoals SGLang, TensorRT-LLM en vLLM voor het distribueren van MoE-modellen, samen met kernels zoals DeepGEMM, formaten als MXFP4 en MXFP8 en NVIDIA Dynamo, spelen een rol.

Dynamo stelt het mogelijk om fases zoals prefill en decode te scheiden en op verschillende resource-groepen toe te wijzen. Het systeem van routing houdt tevens rekening met de VRAM-cache (KV) om herhaald verwerken van hetzelfde context te vermijden.

NVLink verbindt de 72 GPU’s van een NVL72, waardoor ze functioneren als een hoog-snelheids verbonden compute domain. De Vera Rubin-generatie verhoogt het totale NVLink-bredeband van 130 TB/s (Blackwell) tot 260 TB/s, volgens de voorlopige specificaties van NVIDIA.

De huidige publicaties tonen dat deze cijfers nog niet alle mogelijkheden van het platform weergeven. NVIDIA wijst erop dat deze metingen geen rekening houden met de prestaties van Vera CPU voor toolcalls, wat vooral relevant is voor agents die token-generatie combineren met code-uitvoering of externe services.

De voorlopige benchmarks bieden dus een veelbelovend maar nog niet definitief beeld. De getoonde verhogingen van 30 keer throughput en 35 keer kostenbesparing komen van NVIDIA zelf, gebaseerd op AgentX, en worden nog door SemiAnalysis onafhankelijk beoordeeld. Pas na bevestiging door deze review en brede uitrol kunnen we de volledige praktische impact vaststellen.

Veelgestelde vragen

Hoeveel verbetert NVIDIA Vera Rubin ten opzichte van Blackwell?

NVIDIA heeft gemeten dat Vera Rubin NVL72 tot 30 keer meer throughput per megawatt behaalt dan GB300 NVL72 met DeepSeek V4 Pro in AgentX. Dit is een maximale waarde onder specifieke testcondities; het betekent niet dat alle toepassingen altijd zulke prestaties leveren.

Maakt Vera Rubin echt 35 keer minder kosten per token?

NVIDIA stelt dat Vera Rubin in de nieuwe workloads tot 35 keer lagere kosten per miljoen tokens kan realiseren dan GB300 NVL72. Deze resultaten zijn nog niet definitief bevestigd door SemiAnalysis.

Wat is AgentX?

AgentX is een benchmark ontwikkeld door SemiAnalysis die sessies van AI-programmeeragents reproduceert. Het houdt rekening met groeiende context, calls naar tools, variabele invoer- en uitvoerlengten, cache (KV), concurrency en latency.

Waarom is performance per megawatt belangrijk in AI?

Grote datacenters beschikken over beperkte elektrische capaciteit. Het genereren van meer tokens per megawatt stelt hen in staat om meer verzoeken te verwerken zonder de energievoorziening en koeling exponentieel uit te breiden.

Bron: blogs.nvidia

Scroll naar boven