De volgende generatie infrastructuur voor kunstmatige intelligentie gaat verder dan GPU’s alleen. NVIDIA en AMD ontwikkelen complete platforms waarbij CPU, GPU, geheugen, netwerk en opslag samenwerken als één systeem. In dit kader ontstaan NVIDIA Vera Rubin en AMD Helios, twee architecturen met hetzelfde doel, maar met heel verschillende filosofieën.
De kernpunten van Vera Rubin en Helios in 20 seconden
- NVIDIA richt zich op een volledig geïntegreerd ecosysteem rondom Vera Rubin.
- AMD reageert met Helios, een open platform gebaseerd op de Instinct MI500 accelerators.
- Beide systemen zijn ontworpen om duizenden GPU’s in één enkele AI-infrastructuur op te schalen.
- Het verschil zit niet alleen in de rekenkracht, maar ook in de complete architectuur van het datacenter.
NVIDIA: totale integratie van chip tot rack
Met Vera Rubin behoudt NVIDIA de strategie die succesvol blijkt met DGX en GB200 NVL72.
De onderneming verkoopt niet alleen GPU’s. Ze ontwerpt bijna het volledige platform:
- Vera CPU gebaseerd op Arm.
- Rubin GPU.
- Spectrum-X en InfiniBand netwerken.
- BlueField DPU.
- NVLink en NVSwitch connectiviteit.
- CUDA-software, NCCL en de volledige AI Enterprise stack.
Het doel is dat alles samen functioneert als één groot computer-systeem.
De NVL72-architectuur maakt al mogelijk dat tientallen GPU’s intern gekoppeld worden met enorme bandbreedte. Rubin neemt dit concept nog verder door het geheugen uit te breiden, de interconnectiecapaciteit te vergroten en de energie-efficiëntie te verbeteren.
Het voordeel is duidelijk: NVIDIA beheert bijna alle kritieke componenten.
Maar ook het nadeel.
De klant komt in een zeer gesloten ecosysteem terecht, waarbij het vervangt van onderdelen complexer wordt.
AMD Helios: een meer open architectuur
AMD kiest voor een andere filosofie.
Helios is de natuurlijke evolutie van hun Instinct-platformen en zal gebaseerd zijn op de toekomstige Instinct MI500-familie, gekoppeld aan EPYC Venice processors en een nieuwe generatie zeer snelle interconnecties.
Hoewel AMD ook een compleet platform ontwikkelt, blijft hun strategie meer open dan die van NVIDIA.
Ze zetten in op onder andere:
- ROCm als alternatief voor CUDA.
- EPYC CPU’s.
- Instinct GPU’s.
- Interconnecties zoals UALink en Ultra Ethernet.
- Samenwerking met diverse OEM-fabrikanten.
AMD probeert grote cloudaanbieders te overtuigen door meer flexibiliteit te bieden voor het bouwen van op maat gemaakte infrastructuren.
Twee verschillende filosofieën voor hetzelfde probleem
De grote uitdaging is niet meer alleen het ontwikkelen van snellere GPU’s.
De echte knelpunten ontstaan wanneer duizenden accelerators gelijktijdig moeten werken.
Dan spelen aspecten zoals:
- latentie tussen nodes;
- bandbreedte;
- gedeeld geheugen;
- energieverbruik;
- koeling;
- opslag;
- gedistribueerde software.
Daarom spreken NVIDIA en AMD steeds minder over GPU’s en meer over AI Factory en AI Infrastructure.
In beide benaderingen is de GPU slechts een onderdeel van het geheel.
Software: het belangrijkste verschil
Als er één duidelijke voorsprong is voor NVIDIA, dan is het waarschijnlijk in software.
CUDA blijft de standaard voor de meeste AI-ontwikkelaars.
Daarnaast biedt NVIDIA tools zoals:
- TensorRT
- NCCL
- AI Enterprise
- NIM
- Dynamo
- NeMo
AMD heeft de afgelopen twee jaar ROCm aanzienlijk verbeterd en steeds meer modellen werken correct op hun Instinct accelerators.
Toch blijft de volwassenheid van het ecosysteem een verschil maken.
Memory en opslag: een cruciale rol
Een andere belangrijke ontwikkeling betreft opslag.
Modellen voor AI passen niet meer volledig in het HBM-geheugen.
Zowel NVIDIA als AMD ontwikkelen nieuwe architecturen waarin SSD’s met PCIe Gen6, CXL-geheugen en gedistribueerde opslag onderdeel worden van de geheugenhiërarchie.
NVIDIA presenteert initiatieven zoals Storage-Next en SCADA, terwijl alles wijst op een soortgelijke aanpak bij AMD in Helios om de afhankelijkheid van HBM-geheugen te verminderen.
Wat zal beter zijn?
Het is nog te vroeg om te zeggen.
Rubin is nog niet commercieel beschikbaar, en Helios komt later.
Daarnaast zijn veel specificaties nog niet bekend.
Wat wel duidelijk wordt, is dat de concurrentie niet meer alleen gaat om brute rekenkracht van een GPU.
Grote cloudproviders zullen kijken naar onder andere:
- kosten per gegenereerde token;
- energie-efficiëntie;
- gemak van implementatie;
- software-ecosysteem;
- schaalbaarheid;
- beschikbaarheid van geheugen;
- integratie met netwerken en opslag.
Kortom, Vera Rubin en Helios vertegenwoordigen twee verschillende manieren om de volgende generatie AI-fabrieken op te bouwen. NVIDIA blijft inzetten op een bijna volledige integratie van hardware en software, terwijl AMD een meer open en flexibele aanpak nastreeft voor hyperscalers en grote datacenters. De echte strijd zal niet tussen GPU’s zijn, maar tussen complete platforms die aan de groeiende vraag naar steeds grotere en complexere AI-modellen kunnen voldoen.
Veelgestelde vragen
Wat is NVIDIA Vera Rubin?
Het is het toekomstige AI-platform van NVIDIA dat CPU’s gebaseerd op Arm Vera, GPU Rubin, NVLink- en InfiniBand-netwerken en de volledige CUDA-softwarestack combineert.
Wat is AMD Helios?
Helios is het nieuwe AI-platform van AMD, gebaseerd op Instinct MI500 accelerators, EPYC Venice processors en een architectuur ontworpen voor grote datacenters.
Gaat het alleen om GPU’s?
Nee. De strijd verschuift steeds meer naar complete platforms die processors, geheugen, netwerken, opslag en software integreren.
Wie komt het eerst?
NVIDIA en AMD hebben verschillende planningen voor hun nieuwe generatie systemen, maar beide platforms worden verwacht in de komende fasen van AI-infrastructuur uitrol in datacenters.
